人工智能资讯 第33页
聚合当前分类下的最新内容,按时间顺序查看第 33 页精选文章。

OpenAI的GeneBench-Pro:基因测试题真正难在脏数据
OpenAI公开了GeneBench-Pro的10个案例题,材料包括原始prompt、数据集和支撑材料,但没有公布模型成绩、排名或通过率。它的重点不是证明AI能做临床决策,而是把模型推到基因组学里最麻烦的地带:混杂因素、伪影、校准和不确定性。对AI生物医药团队和计算生物学研究者来说,接下来要看的不是模型会不会说术语,而是能不能少犯危险的确定性错误。

OpenAI GeneBench-Pro:31.5%之后,AI科研卡在判断力
OpenAI 发布 GeneBench-Pro,用 129 个合成但贴近真实的计算生物学任务,测试 AI 在基因组学、生物学和科研分析中的高阶判断。GPT-5.6 Sol Pro 最高通过率为 31.5%,比 GPT-5 起初低于 5%进步很快,但仍不到三分之一。真正的变化不是 AI 会不会跑流程,而是它开始被拿来考“能不能做研究判断”。

The AI Compass:AI 圈有了政治罗盘,但别把标签当能力
Simon Willison 推荐了 The AI Compass:一个由 bambamramfan 制作的 AI 立场测试,29 道题后把用户归入 30 种原型之一。它好玩,但不是严肃量表;真正有意思的是,它把 AI 圈的分裂压成了两条轴:GOOD/BAD 与 OVERHYPED/TRANSFORMATIVE。我的判断很简单:标签可以帮人看清分歧,但不能替代把模型接进真实工作流的能力。

Claude Science 公测:它不是新模型,而是 Anthropic 想塞进实验室的 AI 工作台
Claude Science 是 public beta app,不是新的 Claude 模型;它使用用户计划内已有模型,面向 macOS 和 Linux,开放给 Pro、Max、Team、Enterprise 用户。真正的变化在工具层:连接科学数据库、Python/R、HPC/SSH、Modal 和结果溯源。对生命科学团队来说,它更像一个待验证的科研工作台,而不是能替代专业工具和专家判断的万能助手。

Netflix《Wonka’s The Golden Ticket》用 AI 复刻 Gene Wilder 声音:授权之后,边界才开始
Netflix 真人竞赛节目《Wonka’s The Golden Ticket》将于 9 月 23 日首播,9 月 30 日播出两集结局;预告片旁白使用 ElevenLabs 生成的 Gene Wilder AI 声音,Netflix 称已获其家属同意。 这件事的关键不只是声音像不像,而是经典 IP 真人秀化和逝者声音复刻被放进同一个商业包装。 授权能解决一部分法律问题,但观众是否接受、平台是否充分披露、合同如何限制二次使用,才是更难的部分。

Anthropic 没发科学大模型,它在抢实验室工作流
Anthropic 发布 Claude Science,但它不是新模型,也不是更强的生物专用模型,而是把现有 Claude 包进科研计算工作台。真正的变量是工作流入口:数据库、工具链、多智能体协作、可复现输出,谁能嵌进实验室日常,谁就更靠近科研 AI 的预算和权限。

Google 推出 Nano Banana 2 Lite:图像模型竞争开始拼速度和成本
Google DeepMind 发布 Nano Banana 2 Lite,称其为最快、最高效的 Gemini Image 模型,入口已开放到 Google AI Studio,模型参数为 gemini-3.1-flash-lite-image。它的核心价值更像是降低图像生成与编辑的等待时间和调用成本,而不是宣称图像质量全面领先。对开发者和内容团队来说,这类 Lite 模型的意义在于让批量试稿、A/B 素材和快速编辑更容易进入日常流程。

Google 把 Nano Banana 2 Lite 和 Omni Flash 连成了一条低价视频生产线
Google DeepMind 同时推出 Nano Banana 2 Lite 图像模型,并向开发者开放 Gemini Omni Flash 视频生成/对话式编辑模型。关键不是多了两个模型,而是 Google 把低价出图、图生视频、多轮编辑和平台入口接成了一条生产线。开发者该看 API 成本和限制,内容与电商团队该看改稿效率、审核成本和平台依赖。

OpenAI 修掉的不是模型问题,是 AI 基础设施的隐蔽裂缝
OpenAI 工程师批量分析 Rockset 过去一年的生产 core dump,把一组诡异 C++ 崩溃拆成两类根因:一台 Azure 物理宿主机的静默硬件错误,以及 GNU libunwind 中潜伏 18 年的竞态 bug。 这事的重点不在模型能力,而在可靠性方法:大规模 AI 产品已经不能只靠工程师盯单个 core dump 破案,必须把崩溃样本做成可查询、可归因的数据资产。 对 SRE、后端和基础架构团队来说,真正该补的不是口号里的“稳定性”,而是 crash 数据留存、标签体系、硬件相关性分析和开源依赖边界。

OpenAI Signals 数据:ChatGPT 增长正在从尝鲜转向日常使用
OpenAI Signals 显示,ChatGPT 个人用户注册 6 个月后,日均消息数比注册初期高 50%,尝试任务数量翻倍。更有意思的是,增长不只发生在英语和高收入市场:非英语为主用户已超过活跃用户一半,非洲、亚洲和低 HDI 国家相对增速更快。需要看清口径:地区数据是相对 2023 年 7 月的增长,不是绝对用户规模排名;性别相关结论来自姓名推断,不是用户自报。

特斯拉无方向盘 Cybercab 上路:Robotaxi 的账,终于要当街算
特斯拉开始在奥斯汀测试量产版 Cybercab:两座、无方向盘、无踏板,但车内仍有安全监控员。这还不是无人 Robotaxi 商业化,而是把多年承诺推到监管、成本和公众视线前。真正要看的不是车有多科幻,而是它能不能稳定、低成本、可解释地跑起来。

通用 AI 到企业里,账多半要靠专业化来结
Dharma AI 解读 Goldfeder、Wyder、LeCun、Shwartz-Ziv 2026 年论文,核心判断是:AI 在算力、数据和研发时间有限时,会被推向领域专精。通用 AI 未必失败,但通用性进入企业采购后,必须接受成本、可靠性和边界的审计。最受影响的是企业采购负责人和押注单一通用助手的产品团队。

Libby 准备过滤 AI 书籍,但选择权卡在标签是否诚实
Libby 准备上线 AI 内容控制,用户可选择是否显示 AI 生成或参与制作的内容。它保护的是读者的知情权和筛选权,不是自动识别 AI 图书的技术系统。最大软肋在源头:出版方、作者平台和内容供应商是否如实标注。

AWS拿10亿美元做FDE:企业AI竞争开始拼交付能力
AWS成立新的企业AI FDE内部组织,承诺投入10亿美元内部资源,不是对外投资、新基金或合资融资。工程师会临时嵌入客户企业,在客户AWS环境中部署定制化AI代理,并把工作流、AI技能和可复用模式留下来。我的判断是,企业AI竞争正在从模型参数和价格,转向谁能进流程、扛交付、帮客户把系统跑起来。

X 上线托管版 MCP:AI 工具接入更省事,但权限没放宽
X 推出托管版 MCP 服务器,Claude、Cursor、Grok Build 等兼容 MCP 的 AI 工具,可以通过用户自己的 X 账号权限连接 X API。 这次变化不是新增搜索、读帖、查用户或趋势分析能力,而是把过去开发者要自建的接入层交给 X 托管。 开发者会少做一段基础设施活,但仍要面对 API 套餐、速率、权限和反垃圾规则。

让 Claude 少说废话:企业开始按 token 抠 AI 成本
Caveman 让 Claude Code、Codex、Gemini 等编程代理少写寒暄和铺垫,创作者评估可减少约 65%–75% 输出 token,404 Media 测试约省 5800 个 token、65%。这件事的重点不是“让 AI 像穴居人说话”,而是企业 AI 使用正在从包月体验进入 token 核算。采购和开发团队接下来要管的,不只是买哪个模型,还包括默认模型、推理档位、输出长度和员工配额。

AI奇花种子涌入电商:假种子老骗局被生成式图片放大
eBay、Amazon、Etsy 上出现大量用 AI 奇异植物图兜售种子的商品,紫色巨型 teddy bear 向日葵、彩虹玫瑰、蝴蝶形和猫头形植物都在其中。假种子骗局早就存在,生成式 AI 改变的是造假成本和铺货速度。对买家来说,损失不只是一笔退款,还包括错种、搜索误导和未知植物进入环境的风险。

Lumo 2.0 上线:Proton 要证明隐私 AI 不是低配替代品
Proton 本周发布 Lumo 2.0,补上图像分析、图像编辑、图像生成、Projects 记忆和 thinking mode,并称多数查询最高提速 76%。 这次升级的重点不是超越 ChatGPT 或 Gemini,而是把隐私 AI 推到一场硬考试:少拿用户数据,体验还能不能跟上。 对隐私敏感用户,可以试;对重度团队迁移,最好先等第三方评测和更清楚的验证材料。

Every Eval Ever 打通 Hugging Face:模型分数开始补“出处链”
Every Eval Ever 的评测记录现在可以转换成 Hugging Face Community Evals 所需 YAML,提交到模型仓库的 .eval_results/ 目录,并显示在模型卡和对应 leaderboard 上。关键变化不是多了一个榜,而是分数能回链到完整 EEE JSON,读者可以追到来源、模型访问方式、生成设置和指标含义。限制也很明确:目前只支持 MMLU-Pro、GPQA、HLE、GSM8K 四个官方基准,提交仍依赖 PR、人工审阅和模型仓库治理。

OKX AI 开放给开发者:AI Agent 会付钱,交易所想抢机器经济入口
OKX AI 周二向开发者开放,试图让 AI Agent 拥有钱包、链上身份、信誉和稳定币支付能力。它现在还不是面向普通用户的大规模产品,更像一次开发者生态押注。真正的看点是:加密交易所能不能把稳定币、身份和分发网络,变成机器经济的金融入口。

AI 没一刀切掉初级岗位,但公司分层已经开始
Ramp 与 Revelio Labs 基于近 2.2 万家公司数据称,高强度 AI 采用者员工数增长 10.2%,初级岗位增长 12%。这不能证明 AI 创造就业,只能说明“AI 必然消灭年轻岗位”的说法太粗。更关键的变化是:会把 AI 嵌进业务的公司在扩张,只会买订阅和做试点的公司还在原地打转。