人工智能资讯 第86页
聚合当前分类下的最新内容,按时间顺序查看第 86 页精选文章。

Every Eval Ever 打通 Hugging Face:模型分数开始补“出处链”
Every Eval Ever 的评测记录现在可以转换成 Hugging Face Community Evals 所需 YAML,提交到模型仓库的 .eval_results/ 目录,并显示在模型卡和对应 leaderboard 上。关键变化不是多了一个榜,而是分数能回链到完整 EEE JSON,读者可以追到来源、模型访问方式、生成设置和指标含义。限制也很明确:目前只支持 MMLU-Pro、GPQA、HLE、GSM8K 四个官方基准,提交仍依赖 PR、人工审阅和模型仓库治理。

OKX AI 开放给开发者:AI Agent 会付钱,交易所想抢机器经济入口
OKX AI 周二向开发者开放,试图让 AI Agent 拥有钱包、链上身份、信誉和稳定币支付能力。它现在还不是面向普通用户的大规模产品,更像一次开发者生态押注。真正的看点是:加密交易所能不能把稳定币、身份和分发网络,变成机器经济的金融入口。

AI 没一刀切掉初级岗位,但公司分层已经开始
Ramp 与 Revelio Labs 基于近 2.2 万家公司数据称,高强度 AI 采用者员工数增长 10.2%,初级岗位增长 12%。这不能证明 AI 创造就业,只能说明“AI 必然消灭年轻岗位”的说法太粗。更关键的变化是:会把 AI 嵌进业务的公司在扩张,只会买订阅和做试点的公司还在原地打转。

Base44自研Base1:vibe coding不只拼体验,开始拼成本账本
Wix旗下vibe coding平台Base44开始推出自研模型Base1,目标是用平台上的真实用户交互数据,改善延迟、推理成本和应用生成效果。它不等于Base44已经追上Claude、OpenAI或xAI,但说明AI应用公司只做模型调用层,长期议价权会很薄。接下来最该看三件事:Base1的实际效果、单位推理成本下降幅度,以及用户是否愿意为更便宜但可能不总是最强的模型买单。

美团开源 LongCat-2.0:1.6T MoE 之外,AI ASIC 集群才是关键看点
美团 LongCat 团队开源 LongCat-2.0:1.6T 总参数、约 48B 每 token 激活参数,已提供 GitHub、HuggingFace、在线试用和 API Access。我的判断是,模型能力当然要看,但这次更硬的看点是:官方公开展示了用 AI ASIC 超级集群完成大规模训练和部署。它还不能被写成“替代英伟达”,但会让基础模型团队和技术采购方重新评估非 NVIDIA 路线。

OutYet.ai 做了一个 AI 模型“等发布”面板,价值不在爆料而在验真
OutYet.ai 上线等待面板,追踪 OpenAI、Anthropic、Google DeepMind、Meta 等机构的主流 AI 模型是否已开放公共访问。它的真正价值不是预测发布时间,而是用官方接口、仓库或消费端入口的两次验证,替代传闻和新闻标题带来的不确定性。

AI分出了“两种水”,但水之谜还没结案
《Nature Physics》新研究用无监督深度学习分析约7400万个局部水分子构型,在分子动力学模拟中分出两类液态水局部结构。它支持水的两态模型,但不是直接实验看见“两种水”,也不能等同于证明液-液相变。真正的分水岭在两件事:把AI找到的隐藏特征翻译成物理语言,并让实验验证跟上。

韩国押上1万亿美元做AI:真正要抢的是内存、电、水和机器人
韩国政府联手三星、SK海力士、现代、Naver等企业,承诺约1万亿美元AI投资,重点放在存储芯片、AI数据中心和人形机器人。它不是单纯撒钱刺激产业,而是把AI时代最硬的资源重新打包成国家工程。方向押得准,但成本会先压到电网、水资源、采购价格和工人谈判桌上。

8090 Labs 融资 1.35 亿美元:AI 写代码开始过企业审计关
Chamath Palihapitiya 创办的 8090 Labs 完成 1.35 亿美元 A 轮融资,Salesforce Ventures 领投,他本人也从董事转为 CEO 全职运营。 这件事的看点不只是 AI coding 继续吸金,而是企业开始把问题从“能不能写代码”推到“能不能审计、控制、交付、追责”。 对 CIO、采购和开发负责人来说,接下来别急着看 demo,要看这类工具能不能进真实流程。

Gemini 个性化生图免费给美国用户:Google 真正推的是账户语境
Google 将 Gemini 基于 Nano Banana 的个性化 AI 生图开放给美国符合条件的免费用户,原本只面向 Plus、Pro、Ultra 订阅用户。关键不在“免费”,而在 Gemini 可以在用户授权后调用 Gmail、Google Photos、YouTube、Search 等账户语境。普通用户得到的是少写提示词,真正要掂量的是哪些私人数据值得交给默认体验。

Ornith-1.0 开源:Coding Agent 的分水岭,不是参数量
DeepReinforce 在 GitHub 发布 Ornith-1.0,覆盖 9B Dense、35B MoE、397B MoE,MIT 许可,支持 256K 上下文、工具调用和 OpenAI-compatible API。它的看点不是“开源又刷榜”,而是把 coding agent 的竞争推向任务闭环:搜索、调用工具、执行、修复、验证。对开发者和企业来说,真正要算的是部署成本、agent harness 和可复现成功率,不是只看 397B 这个数字。

AI 写完前 80%,工程能力被挤到了更贵的最后 20%
Jonathan Beard 在《The 80% Problem》中提醒:AI 编程很擅长生成 demo、脚手架和 happy path,但生产级系统最费钱的部分仍在后面。真正受影响的不是“会不会写代码”,而是团队有没有人能处理幂等、限流、迁移锁、部分故障和凌晨 3 点的线上诊断。接下来要看的变量,是团队有没有重新设计代码审查、on-call、故障训练和新人学徒制,而不是只统计 AI 省了多少工时。

DiScoFormer:真正要挑战的不是 KDE,而是“每个分布重训一次”
Ai2 发布 DiScoFormer,用一个 Transformer 在单次前向传播里同时估计 density 和 score。它在 100 维评测中相较手调 KDE 明显占优,但更关键的是尝试把“每个分布重训一个估计器”改成“一个预训练估计器跨分布复用”。目前证据主要来自技术报告和合成/受控评测,KDE 在小数据和速度上还没到退场的时候。

Claude 半价进加州:Anthropic 没拿下五角大楼,先去州政府证明安全叙事
加州州长纽森与 Anthropic 达成协议,州级机构和地方政府可半价使用 Claude,并获得培训与支持。协议不是全面部署,只是打开访问入口;用途集中在起草文件、分析信息和提升公共服务效率。真正的看点是,Anthropic 在联邦合同边界受阻后,转向加州证明:带安全限制的 AI,也能进入政府流程。

Arena 年化收入冲到 1 亿美元:AI 排行榜最值钱的不是排名
Arena 商业化服务上线 8 个月后,年化 run-rate revenue 达到 1 亿美元;但它按用量收费,不能直接当成传统可续约 ARR。更关键的变化是:AI 竞争正在把评测、偏好数据和后训练服务推成基础设施生意。模型能力越接近,掌握评测入口和反馈循环的人,议价权越高。

Qwen 3.6 27B:本地大模型摸到日用门槛,但门票很贵
一位开发者实测认为,Qwen 3.6 27B 是当前本地开发的甜点模型:速度不如 35B A3B MoE,但代码、写作和通用任务更稳。它还不是普通电脑上的本地 ChatGPT,更像给本地 LLM 开发者、AI coding 用户和隐私敏感团队的一次现实提醒:质量开始够用,硬件账还很硬。我的判断是,本地模型真正的分水岭不是能跑,而是跑完以后你愿不愿意继续用。

Cursor 上手机:AI 编程开始变成远程管工
Cursor 推出 iOS 应用,开发者可以在手机上启动、提示和监督 coding agent,也能接续桌面端已运行的代理任务。 重点不是在手机上写大型代码库,而是 AI 编程工具正在把开发者推向任务分配、验收和纠偏。 对个人开发者和工程团队来说,真正要看的不是新鲜感,而是 agent 的可控性、审查成本和工作边界。

TIDAL 2026 年起切断全 AI 音乐收益:平台治理不再只靠贴标签
TIDAL 将从 2026 年 7 月 15 日起标注完全由 AI 生成的音乐,并取消其变现、版税和 direct-to-fan 销售资格。 这不是全面封杀 AI 工具,受影响最大的是全 AI 批量上传、冒充艺人和靠平台分账套利的内容。 关键变化在于,流媒体平台开始动收益规则;比起贴标签,断开收入链更可能改变上传者行为。

AI竞赛换了分水岭:模型之外,闭环和万卡工程开始定胜负
Import AI 463 把几个前沿信号放在一起:NVIDIA 用 ENPIRE 测试真实机器人自我改进,腾讯披露万卡训练诊断系统 ARGUS。更硬的竞争点正在浮出水面:物理试错闭环、训练工程、系统可见性,以及人类还留不留在决策链里。对 AI 团队来说,接下来不能只看模型榜单,还要看谁能把系统跑稳、看清、持续改。

一天 AI 账单超过整月服务器:LLM 重试风暴真正烧掉了什么
一次 SaaS 事故里,同一租户的一批重型 LLM 批处理被重复执行 21 次,单日 AI 费用约占当月 LLM 账单一半,并高于整月服务器成本。问题不在用户多用了 AI,而在 LLM 调用已经成功计费,数据库写入却失败,队列又把整批任务重跑。对 LLM 后端团队来说,接下来最该盯的是重试边界、幂等记录和按任务拆分的成本告警。

Pocket 融资 1100 万美元:AI 录音卡片要和手机 App 抢线下对话
Pocket 获得 1100 万美元融资,产品是一块 129 美元、可贴在手机背面的 AI 录音转写设备。它的机会不在泛泛的 AI 硬件复兴,而在线下会议、拜访、问诊、工地沟通这些手机 App 不够顺手的场景。真正的悬念是:Pocket 能否把录音转写接进企业流程,而不是只卖出一批新录音笔。