人工智能资讯 第57页
聚合当前分类下的最新内容,按时间顺序查看第 57 页精选文章。

微软论文说开发者只花14%时间写代码,但这个数字本身就打了架
ACM Queue刊发微软研究团队长文,用'开发者仅14%时间写代码'来拆解AI软件工程八大迷思,批评企业以代码生成行数衡量AI价值。但追溯其引用的原始研究会发现,同一篇论文里图表和正文给出的数字并不一致,说明这场'用证据反炒作'的努力,自己的证据基础也没有想象中扎实。

Gwern传出退休创业?源头链接打不开,消息目前查无实据
网上流传独立研究写作者Gwern Branwen退出全职写作、创办Guardian Angel Inc,但源头推特链接已失效,检索工具给出的也全是猜测性语言,没有一条独立信源能证实这件事。目前能确认的只有一件事:这条新闻还立不住。

130万个地点,不到30条真实评价:AI导览应用Wrinkles的另一面
AI语音导览应用Wrinkles宣称覆盖177个国家130万个兴趣点、对普通用户永久免费,但苹果和谷歌两个应用商店对它的隐私披露互相矛盾,AI生成的历史内容也没有公开的事实核查机制。产品故事讲得漂亮,家底却经不起细看,这才是这条新闻真正值得盯的地方。

3B打败7倍对手?Shieldstral说明书里没写全的事
Mistral发布3B参数、Apache 2.0开源的多模态审核模型Shieldstral,用'策略即问题'的架构在推理时接受自然语言规则,号称匹敌7倍体量的护栏模型。但技术报告的可验证性、'16GB可跑'的真实门槛、以及身份偏见等部署风险,都是发布通稿里没讲的部分。

115GB下载、45分钟出片:MiniMax-H3本地跑通背后,三个原文没提的坑
Simon Willison在M5 Max上跑通了MiniMax-H3的MLX移植版,115GB模型、45分钟生成一段视频,画面不错但音频翻车。但仓库归属可能张冠李戴、许可证明确排除美欧英韩地区使用、量化对这类任务其实只省内存不提速——这些都是原文没说的门槛。

达拉斯撤销候补名单,Waymo机场路线仍是空白
Waymo在达拉斯取消候补名单,人人可直接叫车,这是它在凤凰城、洛杉矶、旧金山验证过的打法复制。爱田机场仍未开通,5月暴雨停运的教训也没翻篇,规模化复制容易,全天候可靠还差一截。

Hank Green因AI使用暂退制作:创作者真正该交代的,不是用没用AI
科普创作者 Hank Green 因使用大模型辅助查找研究资料遭到批评,并承认自己的使用状态“不健康”,但否认让 AI 代写脚本。争议暴露了创作者行业尚未形成清晰的 AI 使用边界:比起要求人人“纯手工”,更现实的标准是来源可追溯、事实经过核验、使用方式如实披露。

OpenAI发布教育插件,可这个词它自己都不用了
OpenAI为ChatGPT Edu推出三款教育「插件」,联手AFT要在五年内培训40万K-12教师,但这个「插件」说法本身就有问题:OpenAI去年已退役plugins体系,2025年底又统一改名apps。签了隐私协议不等于机构不用再操心FERPA,工会合作也不等于教师拿到了决策权。

2640万装机留不住TV Time,一个叫Helix的AI项目才是真答案
TV Time关闭后,联合创始人Antonio Pinto推出Bingers试图复刻其社交追剧体验,但GDPR数据导出窗口已过期,且Trakt、Serializd、Simkl早已瓜分了这个赛道,情怀能否变成留存和收入还很难说。

60个基准,近一半已经饱和:防泄露可能防错了方向
一篇被ICML 2026收录的论文系统分析了60个语言模型基准、14项与饱和相关的属性,发现近一半基准已经饱和,且饱和率随基准年龄增长而上升;更关键的是,真正决定抗饱和能力的是专家策展,而不是测试集是否公开——这戳破了产业里'私有化才能防饱和'的简化叙事。

微软开始给工程师的AI用量设预算:AI-first也要算Token账
据外媒援引内部沟通,微软正为工程师使用部分AI工具设置预算,高管同时强调公司仍坚持“AI-first”。这不等于微软用不起AI,更准确的信号是:当模型调用进入日常开发,企业开始从统计使用量转向核算每一美元能换来多少产出。

Spotify的AI翻唱'首个合法通道',时间线却对不上账
Spotify在Q2财报会上宣布Merlin加入AI翻唱/remix项目,强调'同意-署名-分成'三段论,但Merlin早在十个月前就已上车,'研究预览'一词也被套用到了另一款产品上。厂牌点头不等于艺人点头,这才是这套'合法叙事'真正没讲清楚的地方。

Liquid AI又发新模型,规格却像抄了自己上一款
Liquid AI发布端侧智能体模型LFM2.5-2.6B,宣称2.6B参数能打过4倍体量对手,但其训练量、上下文、推理速度等核心规格与自家同期发布的LFM2-2.6B、LFM2.5-8B-A1B高度重叠错位,且所有对比数据均为官方自测,尚无第三方复现验证。

Bradbury“精准预言”2026年8月4日?这个日期其实改写过两次
Ray Bradbury短篇小说里那栋核战废墟中自动运转的住宅,报时的日子正是今天——但“精准预言2026年”的说法建立在一个被反复筛选的版本上,1950年原刊设定是1985年,1997年修订版又改成了2057年。真正值得琢磨的不是预言准不准,而是小说里“系统越自主、人类越缺席判断”这个隐喻,如今正对应AI介入核预警与军事决策的现实讨论。

读者以为一眼能认出AI配图,研究说,多半认不出
一位博主吐槽AI配图让他不想读博客、甚至怀疑正文也是AI写的,帖子登上Hacker News引发讨论;但多项感知与信任研究显示,普通人辨别AI图像的能力其实有限,真正决定信任的是图片是否被当证据使用、是否披露,而不是“是不是AI生成”本身。

单卡跑通304B大模型?这份MI300X基准报告,查无此模型
一份GitHub仓库详细记录了在单张AMD MI300X上跑通304B参数模型DeepSeek-V4-Flash-0731的全过程,补丁、调优表、基准数字一应俱全,但检索DeepSeek官方渠道找不到这个模型存在的证据,其规格也和已知的V3/R1谱系对不上。工程细节可信,不代表模型本身可信,这才是这份报告最该被追问的地方。

Reddit的"真人推荐",正在变成AI搜索时代的新广告位
护肤社区发现一个账号在多个帖子里反复用近乎相同的话术推荐同款次氯酸喷雾,是否为品牌操作尚无实证。但AI搜索越爱引用Reddit的"真人经验",这份真实就越值钱,也越容易被批量伪造。真正的考验不是抓一个账号,而是平台能不能在商业流量涌入时守住可信这项资产。

Harness才是AI自我进化的引擎,但没人告诉你裁判也能被喂饭
OpenAI前研究员Lilian Weng最新博文提出,包裹在模型外面的'harness'(工作流、记忆、工具调用系统)才是AI递归自我改进的关键引擎,而不是模型权重本身。但她通篇没谈一个问题:如果agent能改进衡量自己的评估器,谁来保证它没有在给自己批卷。

4.3GB内存跑80B大模型,这个数字你敢信几分
开源项目Swiftlet让Qwen3-Next-80B在4.3GB内存里跑起来,还首次把35B模型塞进iPhone,但峰值内存的测量方法从未公开,iPhone的理论提速和实测速度也对不上。工程思路值得肯定,数字本身还需要独立验证。

Steve Yegge 称 Opus 4.7 让 Gas Town 无法收工:Agent 升级最怕行为漂移
Steve Yegge 称,Gas Town 在 Opus 4.6 上运行良好,换到 4.7 后却反复陷入“还要再改两件事”,迟迟无法进入真正任务。这只是单个开发者案例,不能证明模型全面退步,却暴露了 Agent 上线常被忽略的指标:它能否稳定收敛并按时停手。

'肉体代理':AI时代的新词,四十年前的老毛病
程序员Niklas Gruhn造了个新词'meat proxy'(肉体代理),批评人们不加理解就转发AI输出;Simon Willison随手转发,却让这个俏皮词撞上了一条长达四十年的自动化信任研究谱系——人类形式上把关、实质上只是盖章工具的问题,从未被真正解决,只是换了个战场。