人工智能资讯 第36页
聚合当前分类下的最新内容,按时间顺序查看第 36 页精选文章。

阿特伍德批评 AI:真正危险的是错得很流畅
阿特伍德在葡萄牙波尔图 Babell 文学与文化节谈到,她只用过一次 Claude,查询英剧《布朗神父》信息时就拿到错误答案。她的批评不是反科技,而是提醒用户:大模型不是事实机器,流畅回答仍要人工核验。对内容创作者和知识工作者来说,AI 可以省起草时间,但不能省掉查证成本。

35岁创业者患罕见淋巴瘤:Claude没有治癌,但帮他问对了问题
35岁创业者Connor Christou在多年体检正常后,被查出胸骨后方约11×11×8厘米的罕见侵袭性非霍奇金淋巴瘤。治疗中,他把血检、影像、可穿戴设备数据和语音症状日志输入Claude,用来整理材料、生成问题、准备多方专家意见。这个案例的价值不在于AI诊断癌症,而在于通用AI已经能帮患者补一部分信息差,但关键判断仍必须由医生复核。

Anthropic 出口限制后,Sakana 和 360 开始填补亚洲 AI 安全空档
美国约两周前限制 Anthropic 向非美国用户提供 Mythos 与 Fable 5,日本 Sakana AI 和中国 360 随后推出面向编排、安全防御的替代产品。 目前没有公开证据能证明这些产品已追平 Mythos,但它们抓住了同一个采购痛点:先进能力之外,能不能稳定使用正在变成硬指标。 受影响最大的不是普通用户,而是把 AI 接入漏洞发现、事件响应和代理流程的企业与政府客户。

DeepSeek 开源推理优化:比模型跑分更硬的是 token 成本
DeepSeek 在 GitHub 仓库 deepseek-ai/DeepSpec 公开 DSpark_paper.pdf,论文/项目宣称生成速度提升 60%–85%。这个数字还不是第三方验证结果,但方向很关键:大模型竞争正在从训练炫技,压到推理吞吐、延迟和部署成本。真正要看的是复现难度、适配范围,以及线上账单能不能真的降下来。

Claude Mythos 5 只对白名单放行:前沿模型发布权正在移交
6 月 26 日,美国商务部致信 Anthropic,允许 Claude Mythos 5 向 Annex A 名单内的 100 多家可信美国机构、企业和政府部门开放。它不是全面公开发布,Fable 5 也尚未正式放行。更重要的是,前沿模型发布正在从公司产品节奏,变成政府安全审查、白名单准入和地缘政治工具的一部分。

AI 做出可发表级数学结果后,真正被改写的是数学家的训练方式
AI 数学系统已经从解奥赛题,推进到发现反例、产出可发表级研究和形式化验证前沿证明。它还没有全面取代数学家,但已经碰到纯数学研究的核心流程。真正的争议是:数学的价值到底落在答案上,还是落在人类能理解、能交流、能继续协作的证明过程上。

美国有限放行 Anthropic Mythos 5:能用的人多了,但门没有打开
特朗普政府在禁令生效约两周后放松限制,允许 Anthropic 向逾 100 家指定美国政府机构和公司提供 Claude Mythos 5。 这次放行覆盖相关组织内的非美国籍员工,也包括 Anthropic 自身非美国籍员工,但不是向所有用户重新开放。 更关键的信号是:美国正在用“可信名单+安全审查”管理前沿 AI 模型访问权,Fable 5 仍未被同步放行。

Mythos 5 部分回来了,但前沿 AI 的发布权被收走了一块
特朗普政府在两周谈判后,允许 Anthropic 的 Mythos 5 向少数网络防御和基础设施机构恢复开放;面向公众的 Fable 5 仍没有推出协议和时间表。 6 月 26 日的信只调整了许可要求,没有撤销两周前的出口控制指令,外国国民仍被禁止访问相关模型,包括 Anthropic 自家员工。 这件事的重点不是一个模型回归,而是前沿 AI 正被推入按场景、身份和风险分层授权的发布体系。

美国有限放行 Anthropic 的 Claude Mythos 5:不是恢复上线,是带名单放行
美国商务部已允许 Anthropic 将 Claude Mythos 5 开放给部分“可信伙伴”,依据是路透称已看到的一封商务部致 Anthropic 的信函。\n这不是面向所有用户的全面恢复,而是一次带名单、带边界的有限放行;名单外公司仍受限制。\n更值得看的是 Fable 5 是否会获准发布,以及美国会不会把前沿模型访问长期纳入类似出口许可的审查逻辑。

美国放行 Anthropic Mythos 5:名单内能走,监管还没松
Techmeme 转述 Semafor 信件和消息称,美国已解除对 Anthropic Mythos 5 的发布阻止,允许其向 100 多家美国机构开放。Fable 5 仍在谈判中,未获同等放行。我的判断是,这更像按模型、按客户放行的有限许可,不是美国前沿 AI 监管全面转向。

美国要管前沿模型,AI 基建的全球账本先紧了
Simon Willison 摘引 Dean W. Ball 的判断:限制前沿 AI 模型广泛可用,冲击的不是单一出口问题,而是模型发布后数月的回本窗口。更大的矛盾在数据中心:百亿美元级 AI 基建押的是全球需求,不是少数获批客户。接下来要看访问闸门有多窄,以及企业客户会不会因为不确定性延后采购。

Corgi 否认抄袭 Papermark:AI 生成的相似产品,边界在哪
YC 支持的保险科技公司 Corgi 被开源数据室软件 Papermark 指控抄袭,Corgi 否认使用对方代码,但承认部分 vibe coding 页面借鉴了竞品表达并已修改。现在能确认的争议点不是“偷没偷源码”,而是产品界面、文案和功能组织高度相似时,该如何判断抄袭边界。对开源团队和采购方来说,这件事会直接影响代码审查、供应商尽调和 AI 辅助开发流程。

开放权重模型追平闭源?别被 2026 年那个日期带节奏
Doubleword 用 Artificial Analysis 的 18 项指标重算开放权重 LLM 与闭源前沿模型的差距:单看 Intelligence Index,会线性外推出 2026 年 12 月 3 日追平;换多指标平均看,差距长期仍接近 5 个月。真正的变化在编码能力,落后从约 15 个月缩到 1-2 个月。问题不在开放权重有没有进步,而在一个总分很容易把局部胜利包装成全面追平。

LLM不是零门槛:它把门槛挪到了管理和验收上
Simon Willison 收录了 Timothy B. Lee 的一句评论:说 LLM 没有学习曲线,就像说当经理不用学习,因为员工会照你说的做。重点不在这句话有多像理论,而在它戳破了“会打字就会用 AI”的偷懒说法。LLM 降低了入口,但真正的门槛变成了设目标、拆任务、给反馈、做验收。

纽约时报改诉状:AI 版权战开始追问微软的算力责任
《纽约时报》申请修改对 OpenAI、微软的版权诉状,把微软为 OpenAI 定制超级计算系统的行为,指向“主动诱导侵权”。 关键背景是 Cox/Sony 案相关裁判后,共同侵权门槛被抬高,原告需要证明被告有意诱导非法行为。 这起案子的看点不只是 ChatGPT 有没有输出文章片段,而是云厂商还能不能把自己说成中立基础设施。

OpenAI请来Uber印度前负责人:印度不只是ChatGPT用户池了
OpenAI任命前Uber印度及南亚总裁Prabhjeet Singh为印度首位董事总经理,9月到岗,向亚太董事总经理Kiran Mani汇报。印度被OpenAI称为美国之外第二大市场,但这里不能直接理解成营收第二大。更值得看的是,OpenAI正在把印度从用户增长地,推进到企业采用、伙伴合作、监管沟通和算力布局并行的本地经营市场。

OpenAI 限量发布 GPT-5.6:前沿 AI 正被推向“事实许可”时代
OpenAI 应美国政府要求,将 GPT-5.6 系列首轮发布限制在少数可信伙伴范围内,参与名单已与政府共享。真正重要的不是 Sol、Terra、Luna 的模型升级,而是美国对前沿 AI 发布的事前审查,正在接近一种事实上的准入许可。OpenAI 配合了本次安排,但明确反对把这种流程变成长期默认机制。

OpenAI最新模型访问权将由美国政府审查,AI监管换了入口
OpenAI称,希望使用其最新一代ChatGPT/GPT技术的公司,将由美国联邦政府参与审查。这里管的不是普通用户登录ChatGPT,而是企业拿到前沿模型能力的资格。特朗普政府曾宣称放松AI监管,但这次动作说明,监管并没有退场,只是从写规则转向卡入口。

两个 AI 审查员吵了 340 条:假事故里有真风险
Simon Willison 转发了 Andrew Nesbitt 的虚构讽刺事故《CVE-2026-LGTM》,核心桥段是两个 AI 代码审查代理在依赖升级 PR 里互相争执,留下 340 条评论和 41,255 美元推理开销。它不是一条真实 CVE,也不是安全事故报道。真正刺中人的地方,是 AI 审查一旦接入工程流程,成本、权限、责任和厂商营销会一起失控。

GPT-5.6 Sol 先限量预览:强模型的发布按钮,不只在产品团队手里了
OpenAI 开始有限预览 GPT-5.6 系列,旗舰模型 Sol 暂时只给少数可信伙伴使用,并已与美国政府做发布前协调。Sol 强调编码、生物和网络安全能力,但官方也划了边界:它未跨过 Cyber Critical 阈值,测试中没有自主完成完整攻击链。真正的变化不是模型又强了一点,而是前沿模型发布正在被能力、安全闸门和访问权一起决定。

GPT-5.6 Sol 先限量预览:OpenAI 把最强模型放进了“安全闸门”
OpenAI 预览 GPT-5.6 系列:旗舰 Sol、均衡 Terra、低成本 Luna。Sol 主打代码、科学、生物和网络安全长任务,但目前只给少量可信伙伴有限预览,未来数周才计划更广泛可用。 这次最该看的不是模型又强了多少,而是发布方式变了:当前沿模型碰到网络安全风险,产品上线开始变成能力、安全和政府协调之间的拉扯。 对开发者和企业来说,Sol 还不是立刻迁移的信号;更现实的动作是评估长任务收益、等待 API 与价格细节,同时把安全边界纳入采购判断。