人工智能资讯 第44页
聚合当前分类下的最新内容,按时间顺序查看第 44 页精选文章。

41岁、两级研究学位之后,这名学者决定从零学NLP
一名在俄罗斯取得两级研究学位的学者,承认自己仍无法用非学术语言说明研究发现及其有效性,于41岁转学计算语言学和NLP。真正刺痛人的不是中年转行,而是一个更普遍的问题:路径再难、晋级再久,也不能自动证明成果有外部价值。代码同样会骗人,但数据、程序失败和真实用户至少能给工作加上更明确的否决条件。

DiffusionGemma:单卡1500 tokens/s,是解码范式突破还是漂亮的演示
DiffusionGemma把Gemma 4微调成扩散语言模型,论文称单张H100能跑到约1500 tokens/s,新增训练量不到原模型的10%。但首token延迟、显存占用、量化精度、对比基准这些决定部署成本的细节,论文都没有交代。真正的答案要等社区拿到权重、换上自己的硬件之后才有。

Slack上线'氛围编程'频道,自己却一行代码没写
Slack推出协作式编程频道,团队可在频道里@Claude Code、Devin等agent直接生成代码、审代码、预览效果。但拆开看,真正生成代码的仍是Cursor、GitHub Copilot、Replit这些第三方agent,Slack做的只是协调层这一件事。

把训练数据扩大5倍,这个钢琴AI反而变笨了
独立开发者用一年时间训练出1.25亿参数模型,在iPhone上实现每秒108音符的实时钢琴续写,核心突破不在模型大小,而在把音符打包成复合token和用DPO做后训练。把数据集扩大5倍反而让效果变差的教训,比跑分数字更值得记住。

一个网站教你别再甩AI回复,但真正的争议在别处
一个叫dontpastetheai.com的极简网页,呼吁人们别把ChatGPT原文直接甩给提问者,却在Hacker News、GitHub等平台掀起跨圈层共鸣。更值得关注的是它catch不住的反转:写得工整的人类原创,现在反而更容易被冤枉成AI代写。

写代码快了十倍,工程团队卡住的却是脑子
Simon Willison在Talking Postgres播客里说,coding agent能把每天的代码产出从两百行推到上千行,但前提是调试通过、可维护、测试齐全,质量不能打折。他更担心的是另一件事:功能变便宜之后,软件会像温彻斯特神秘屋一样不断加建,概念完整性反而更容易散架。

这句被转发疯了的AI箴言,查无实据
Simon Willison引用的Jeremy Morrell那句「LLM+sandbox给用户超能力」的名言,检索发现出处存疑,且与2023年Geoffrey Litt的经典论述高度重合;而现实中的Pi coding agent已经因为默认不设sandbox引发误删文件的真实事故,说明这套愿景在落地时远比一句箴言复杂。

Waymo新出租车全城开放,关税却在拖后腿
Waymo第六代无人出租车Ojai已在洛杉矶、凤凰城、旧金山向全体乘客开放,年内还将扩展到丹佛、拉斯维加斯和圣地亚哥。但这款靠中国产极氪车身压低成本的车队,正撞上高额进口关税,测算显示单车到岸成本可能逼近9万美元,Waymo“更便宜”的商业叙事和Alphabet财报里持续亏损的Other Bets板块之间,还有一道没填平的沟。

帕特洛被曝为奥特曼设宴:晚宴尚待证,利益关系已经上桌
媒体称格温妮丝·帕特洛将为山姆·奥特曼举办晚宴,并提到她的投资公司 Kinship Ventures 投资了 OpenAI。消息目前缺少日期、地点、宾客名单及当事方确认,合理标签只能是“待核实”。即使晚宴成行,它说明的也是资本与名流正在互相试探,远非好莱坞已经接受生成式 AI。

48小时闪电融资、10亿估值:AI记账独角兽Rillet的证据链够厚吗
AI原生会计初创公司Rillet完成1亿美元C轮融资,估值达10亿美元,ICONIQ连续三轮加注,公司称ARR三个月翻倍。但第三方评价样本量小、定价不透明、AI在复杂会计判断上的边界,都是这个10亿估值目前还没被充分验证的部分。

Google开学季甩出AI学习工具大礼包,拆开一半是旧闻回炉
Google在8月19日集中发布了一批AI学习工具,但多数功能其实在过去一年里已陆续单独上线过,这次更像开学季的整合营销;更关键的是,此前被明确排除在教育账户之外的3D模拟功能是否已对学生开放,Google在发布中只字未提。

AI越用越多,人却越不买账
美国人对AI的担忧比例从2021年的37%升到52%,超七成觉得AI跑得太快,数据中心已经变成地方选情和公司让利成本。行业以为普及自然带来接受,现实是普及越猛,代价先摊给用户,收益却还没兑现。

Unsloth新量化称领先全行业10%,社区实测却报告倒退18%
Unsloth发布Dynamic v3.0量化文件,宣称Qwen3.8-27B在同等体积下准确率超越所有竞品10%以上,5天下载超510万次。但第三方测算的文件体积、社区编码基准的倒退报告和多后端崩溃案例,都说明这套自证指标离真实任务表现还有一段距离。

Pixel Watch 5测试透出的信号:Google的AI健康教练还没想清楚怎么落地
《Verge》编辑今年8月测试Google Pixel Watch 5,并在Made by Google活动前采访了Google健康与家庭业务副总裁Rishi Chandra,发现AI健康教练和疾病预警仍停留在愿景阶段。卡住行业的不是传感器精度,而是AI建议的可靠性、健康预警引发的焦虑与监管成本、个性化建议依赖的私人数据这三道坎。普通用户暂时不必为这套愿景换表,厂商和健康业务的预算决策者则要先把数据授权、误报责任、认证成本这几笔账算清楚。

OpenRouter并入Stripe:官方说一切不变,外部估值先自己打起来
OpenRouter宣布加入Stripe,官方强调品牌、产品、路由逻辑'一切不变';但外部媒体给出的估值传闻从70亿到100亿美元不等,连口径都没对齐。真正的看点不是这次收购值多少钱,而是这个'AI界中立层'的中立承诺,能不能扛过所有权变更后的激励结构。

Meta AI 上了 Mac,但官方比外媒说得少
Meta AI 终于补上 Mac 客户端,官方确认的功能只有窗口共享和连接 Google Workspace 两条,其余更完整的营销分析类功能清单来自媒体报道,Meta 自己至今没有正式公告。这种信息落差恰好暴露了它的真实定位:一个披着生产力外衣的广告营销工具,而不是隐私干净的桌面助手。

Ornith-1.5号称打平Claude Opus,DeepSWE这一项却输了3分
Ornith AI发布397B、35B、9B三档开源模型Ornith-1.5,官方称旗舰款在关键基准上打平Claude Opus 4.8,但完整跑分表显示这更像是挑了赢面最大的指标讲故事。真正值得留意的,是低激活参数的35B-A3B和第三方独立榜迟迟没收录的成绩单。

「97%恢复率」的另一面:2.6B模型量化缺口只补回48.4%
Liquid AI为LFM2.5系列发布QAD量化检查点,宣称4-bit版本能恢复97%左右的BF16性能,但按另一种更严格的算法,旗舰款2.6B模型实际只补回了48.4%的量化损失,且所有跑分目前都来自其自己的测试。

Calendly杀入会议AI混战,官网自己先打了一架
Calendly推出会议记录工具Notetaker和AI助理Callie,正式加入会议AI混战,但Notetaker仍处限量测试、定价页与营销语自相矛盾,CEO强调的“会后自动化”差异化恰是Calendly相对Fireflies、Fathom最弱的一环。

Amodei松口AI治不了癌症,Vivodyne给出的数字却查不全账
Vivodyne在旧金山附近开出自称全球最大的人体组织实验室,想用因果数据填补AI制药的关键缺口,这与Anthropic、OpenAI、Google DeepMind近期对'AI治愈癌症'说法的集体降温同时发生。但公司自己引用的三个关键准确率数字里,只有一个能在官方材料中查证,另外两个来源不明,说明这个行业目前缺的不只是数据,还有可核查的证据。

对着摄像头挥手弹琴:陀螺仪是真的,手却是猜出来的
网页作品《Air Theremin》让人挥手或倾斜手机就能弹电子提琴,但页面并排展示的GYRO和HANDS其实是两种完全不同的技术:前者是手机真实陀螺仪数据,后者大概率只是摄像头对手部位置的视觉估计。作者身份、技术栈和数据处理方式,页面全都没交代清楚。