The Verge编辑Allison Johnson写了篇模仿法庭辩护词的专栏:她带娃露营一晚,邻营喧闹到凌晨两点,5岁孩子占了整张气垫床,半夜还要摸黑带娃上厕所,睡前又喝了两杯罐装鸡尾酒,天亮后松鼠和不知名的鸟接着吵。就这样,她居然还睡出了几个小时的连续深睡。可Pixel Watch给出的睡眠分数是71分(满分100),她"上诉",要求陪审团把分数改判到80分。

通篇是玩笑,但玩笑戳中了一个正经问题:这个从不解释判决理由的"法官",自己经得起审吗。

发生了什么

场景是露营夜,干扰因素一堆:邻营噪音、同床儿童、半夜如厕、酒精、清晨鸟兽声。结果是Pixel Watch打出71分,作者写文"上诉"要求改判80分,语气自嘲,但吐槽点很真实——她不知道扣分逻辑,只能凭感觉argue。

这种吐槽能在社交媒体上反复出现,不是巧合。真正的问题不是71分公不公平,而是没人知道这个分数怎么算出来的

法官从不出示判决书

Google官方说明,睡眠评分基于几项因素:总时长、入睡耗时、"稳定睡眠"(浅睡/深睡/REM期间心率是否低而平稳)、烦躁程度、清醒次数、清醒总时长,再和一个按年龄性别定制的目标做比较。

这几项听着挺科学,但具体权重从没公开过。Fitbit的旧算法反而透明:时长占50分、质量(深睡+REM)占25分、恢复(心率+烦躁度)占25分,加起来正好100分。这套旧公式已经被新算法取代,Google在支持页面上明确写着:用户没法切换回旧版。

你面对的是一套黑箱公式,连"这次为什么扣分"都查不到明细,只能像作者一样,拿着"情有可原"的理由跟一个不会说话的算法讲道理。

睡眠分数怎么算出来 心率 体动数据 六项维度 时长/入睡/稳定睡眠 烦躁/清醒次数/时长 加权公式 权重未公开 71 睡眠分数 旧版Fitbit公式曾公开:时长50分+质量25分+恢复25分,新版取代旧版后权重从未公布。

打分的尺子,自己没被量过

比黑箱更麻烦的是:这把尺子,从没被独立证明是准的。

多导睡眠图(PSG)是睡眠医学的金标准。近几年多项实验室对照研究把消费级手表和PSG做了比对:一项针对11款设备的研究里,Pixel Watch在深睡/浅睡/REM/清醒四阶段分类上的逐段准确率只有63.55%,一致性指标Cohen's kappa仅0.40,统计学上属于"中等一致",离"可靠"还有距离。

对Fitbit Sense 2的验证显示,判断"睡着还是醒着"这种粗分类,敏感度能到95%以上,但一旦细分到具体睡眠分期,敏感度掉到61.7%-78%,深睡和REM的整夜估计和PSG明显对不上。另一项覆盖六款腕表的研究发现,Fitbit系列普遍高估睡眠效率、低估清醒时长,误差经常超过30分钟——这个量级放在临床或研究场景里已经不算合格。

Google自己也做过内部研究,称新算法把kappa从0.56提到0.63、准确率从71%提到77%,听着是进步,但这是厂商自证,不是第三方验证。截至目前,没有任何一项同行评审研究直接验证过0到100这个复合分数本身——所有独立验证都停在底层的睡眠时长和分期上,分数本身是个从未被单独审计过的黑盒产物。

这把尺子,自己有多准 四阶段准确率 63.55% 分期一致性κ 0.40 睡醒判断敏感度 95%+ 分期敏感度 62-78% 官方自测准确率 77% 前四项来自独立PSG实验室验证研究,末项为Google内部研究,非第三方数据。

71分到底冤不冤

睡眠科学界的共识其实很朴素:这类分数适合看长期趋势,不适合当单次的绝对判决。同一个人同一晚,今天71分明天可能78分,波动本身就在算法误差范围内打转。厂商却把它做成考试分数的样子,配上颜色和评语,天然诱导用户把它当权威结论。

睡眠分数更像体温计,不是判决书
  • 风险.用户可能因一次低分焦虑、调整作息甚至就医,但支撑这个分数的算法本身还没有独立临床验证

露营、饮酒、同床带娃这类非常规场景,现有验证研究一个都没覆盖过。设备是在实验室安静环境下被验证的,拿到帐篷里、气垫床上、心率被鸡尾酒和熬夜共同扰动的夜晚,准确率会不会进一步下滑,目前谁也说不清。这恰好是原文里"情有可原"最站得住脚的地方——不是矫情,是验证空白。

古人打官司讲究"疑罪从无",可穿戴设备的算法连证据链都没打开给你看,倒是先给你判了刑。作者要求把71分改判80分,听着像撒娇,换个角度看,她其实在问一个正经问题:凭什么信你。


  • 结论.真正值得盯的不是这一次71分冤不冤,而是Google会不会公开权重和第三方验证结果,竞品会不会拿"算法透明"做差异化,监管会不会开始过问健康类穿戴设备的科学依据

在这些答案出现之前,手腕上的这个数字,更适合当参考,不适合当判决书。