SEA SLUT IIBILBOAT BAGGINS,数据记者Jon Keegan最近做的一份船名图鉴在社交网络上传开了。他从NOAA的AIS船舶广播数据里筛出5万个带名字的船只,做成一个可搜索、可分类的互动网页,里面塞满了荤段子、《指环王》梗和对冲基金黑话。这份东西确实好看,但它悄悄绕过了一个问题:这些船名从哪来,能不能当真。

答案是:能当娱乐,不太能当画像。

15万艘船,只有三分之一留下了名字

Keegan的数据来源是NOAA Marine Cadastre整理的AIS(船舶自动识别系统)广播记录。这套系统最初是给65英尺以上的商业船舶设计的强制定位装置,陆基接收站沿美国海岸线和内河布设,捕捉过往船只的信号。

Keegan从中筛出约15万艘具备唯一身份标识的船,其中只有约5万艘填了名字——不到三分之一。这5万艘里,43%是休闲游艇,14%是货船,剩下的是渔船、拖船、客船和少量军用及搜救船。

也就是说,标题里那个漂亮的“5万”,本身就是一次层层筛选后的子集,不是什么船只普查。

从AIS信号到“5万个船名” AIS广播信号 陆基站接收 15万 唯一识别的船只 (去重后) 5万 带船名的子集 不到三分之一 5万船只的构成 休闲游艇 43% 货船 14% 其余:渔船 / 拖船 / 客船 / 军用与搜救船

船名这一栏,从来没人验证过

Keegan把职业梗当成船主群体的“真实生活切片”来解读——律师取名PRO BONO,医生取名CADUCEUS,对冲基金经理取名LIQUID ASSETS。这套解读挺有意思,但建立在一个不太结实的地基上。

AIS的船名字段(VesselName)是操作者手动录入的自由文本,官方文档明确建议用MMSI码而不是船名来识别一艘船,原因很直接:这个字段可能拼错、可能过时、可能被多艘船共用,甚至可以随便填、被人恶意伪造,系统没有任何校验机制拦着。一个看起来煞有介事的名字,未必对应真实身份,也未必是船主此刻还在用的名字。

  • 提醒.船名字段没有验证机制,行业惯例(如MarineTraffic等平台)也只把它当线索,不当身份证明。

强制安装AIS的规则本身也有大量例外——只覆盖部分65英尺以上商船、拖船和危险品运输船,休闲游艇大多是自愿加装、自愿广播。愿意花钱装设备、愿意公开自己位置和船名的船主,本身就是更愿意炫、也更有条件炫的那一小撮人。这意味着5万个船名里,法律、金融、医学从业者的梗特别多,未必是因为这些职业更爱开船,而是这批人本来就更容易出现在“自愿曝光”的那一端。

覆盖范围也有物理边界:陆基接收站的有效范围大约二三十海里,沿海和港口密集,远海和内陆很多水域根本收不到信号。没进数据库,不代表船不存在,只代表它没被这套网络“看见”。


两组统计对不上号

Keegan引用了美国海岸警卫队2018年的拥船人口调查,说拥船家庭里82.9%是白人,用来给船名的职业气质找社会背景。这组数字描述的是全体拥船家庭,而AIS船名对应的是愿意自费装设备并公开广播的那一批船主——两者未必是同一群人,直接嫁接容易把“自我选择出来的高调群体”误读成“美国船主的平均画像”。

船名好玩是真的,样本干净是假的。

这不是说这份图鉴没价值。作为“政府数据里藏着的个性痕迹”系列的又一次尝试,它延续了Keegan此前挖机场航路点命名、车牌申请记录的路数,本身是个讨巧的数据新闻选题。但娱乐性强不等于代表性强,普通读者刷到这些段子时,容易把“5万个搞笑船名”直接脑补成“美国船主的真实群像”,这中间隔着不止一层筛选。

谁该多留一个心眼

对普通读者而言,把这份图鉴当成一份趣味彩蛋看就够了,不必据此推断“律师都爱开船”或“游艇圈都是这个调性”。

对做类似选题的数据新闻从业者,这案例提醒了一件更具体的事:拿政府公开数据讲故事时,字段本身的采集方式和验证程度,值得在正文里交代清楚,否则读者很容易把“有趣的样本”误认成“可靠的普查”。后续如果有人对这份数据集的代表性提出质疑,或者Keegan自己补一版方法论说明,会是值得跟进的下一步。