人工智能资讯 第79页
聚合当前分类下的最新内容,按时间顺序查看第 79 页精选文章。

OpenAI立下国家安全三条红线,问题是谁来验证
OpenAI发布《国家安全原则》,同时披露一个月内与八国及欧盟机构建立网络防务信任合作、扩大生物安全模型访问权限,其国防业务已包含一份两亿美元级合同。但公司自证式的“不用于监控、不用于自主武器”承诺至今没有第三方审计,参议员沃伦已在国会追问合同细节能否公开。

AI写的PR描述,为什么比没有还糟?
工程师Kenton Varda在团队内部禁用AI生成的PR描述、commit信息和issue文字,理由是这类文本详细复述代码本身就能看出的细节,却漏掉审查者真正需要的意图说明。问题不是AI写得不够细,而是它擅长的信息维度和PR消息的核心价值本来就不在一个频道上。

麦康奈尔病床假照翻车:Google水印赢了一局,但这场胜利经不起细看
一张米奇·麦康奈尔病床惨状的AI假图疯传后被Snopes借助Google的SynthID水印戳穿,这被称为'罕见但重大的胜利'。但破案的关键其实是生成工具主动参与水印计划,而非系统主动识破谎言,这恰恰暴露了深伪检测的真实覆盖率有多窄。

8分钟数据、23亿估值:机器人的ChatGPT时刻是真是假
General Intuition称用视频游戏动作数据训练的模型,只需8分钟真实数据微调就能让四足机器人在办公室里zero-shot行走,公司借此叙事一个月内把估值从传闻的20亿美元推到23亿美元。但目前所有证据只来自公司自证的单一演示,没有第三方复现,也没有披露失败率和任务边界。

Grok 4.5发布:马斯克对标错了一代,还有个神秘模型全程领跑
xAI发布Grok 4.5,定价比Opus级模型便宜不少,但摊开官方自己公布的跑分表会发现,马斯克拿来对比的是旧一代Opus 4.7,而不是同代的Opus 4.8——在Grok重点强调的SWE Bench Pro测试里,Opus 4.8其实领先Grok 4.5。榜单里还有一个叫Fable(max)的模型全程夺冠,却没人解释它是谁。

微软开源Flint:AI画图表,先过编译器这一关
微软研究院联合人大IDEAS Lab开源可视化中间语言Flint,用语义类型和编译器把AI生成的图表规格翻译成Vega-Lite、ECharts、Chart.js配置。它省的是调试底层参数的成本,不是画图能力,效果全看数据语义标注是否到位。三个后端渲染能力并不对等,Flint也不是BI工作流的替代品。

Google 出的考卷,自家 Gemini 却排到第五
Google 更新了自研的 Android 开发基准 Android Bench,新增 Claude Fable 5、GPT 5.5 等八款模型,结果自家 Gemini 3.1 Pro 反而跌到第五名,排在 GPT 5.4、Claude Sonnet 5 和 Claude Fable 5 之后。更值得琢磨的是,这份自己出题的榜单,本身也在改版中悄悄挪动过分数。

点一下'不感兴趣'能砍掉八成内容,但TikTok算法几天就把你打回原形
美国西北大学团队用90个傀儡账号实测发现,TikTok的'不感兴趣'按钮能让同类内容减少约84%,远胜单纯划走的48%,但只要用户后来多看几秒同类视频,算法就会悄悄把内容推回来。Instagram、YouTube也有类似的半吊子控制工具,说明这不是TikTok一家的产品瑕疵,而是整个推荐系统把'看了多久'看得比'说了什么'更重。

Google Photos上新AI剪辑术,水印真挡得住深度伪造吗
Google Photos新增Video Remix,靠Gemini Omni几秒内给旧视频补光、换背景、上艺术风格,14国订阅用户先用。但三个月内相册里已经堆了三个功能相近的AI生成工具,唯一的安全网SynthID水印,连Google自己都承认防不住裁剪和转码。

OpenAI教师AI培训营开进8城,但69%教师仍无人指导
OpenAI Academy联合Walton Family Foundation从7月8日起在美国8座城市为1600多名K-12教师办线下AI培训营,但其宣传语里的“教师用AI每周省5.9小时”这一数据挂错了报告名,同一批调研更显眼的发现——69%教师从未获得任何AI教学指导——反而没被提及。一场线下workshop,填不平这么大的缺口。

23亿美元估值背后:一家游戏集锦网站怎么变成了AI训练数据公司
General Intuition用游戏数据训练AI的说法背后,真正的信息增量是它脱胎于游戏集锦平台Medal TV,而不是凭空冒出的AI实验室。这条路径让游戏UGC第一次被明码标价成训练燃料,但虚拟物理能否迁移到真实世界、数据授权链条怎么理顺,目前都还没有答案。

GPT-Live上线,OpenAI没说清的是延迟和隐私
OpenAI发布全双工语音模型GPT-Live,能一边听一边说、适时插话,背后调用GPT-5.5处理搜索和推理;但免费用户用的是阉割版mini,官方全程未公布一个延迟数字,全双工语音的隐私风险也只字未提。

42.3%对43.0%:SWE-1.7逼近GPT-5.5,但出题打分的是Cognition自己
Cognition发布新一代编程模型SWE-1.7,在自建的FrontierCode等基准上以更低成本逼近GPT-5.5、Opus 4.8的分数,训练细节里熵坍缩治理、跨三大洲分布式RL、self-compaction这些工程手法是实打实的增量信息。但支撑'打破post-training天花板'这一说法的评测体系由Cognition自建自评,竞品版本号也待核实,结论目前只能算一家之言。

Prime Intellect融10亿估值:企业自建AI,换了个依赖对象
Prime Intellect完成1.3亿美元A轮融资,估值10亿美元,年化收入已达1亿美元,靠的是给企业提供训练AI agent的全套基础设施。但仔细看Ramp、Zapier的案例和竞争格局就会发现,企业摆脱OpenAI、Anthropic的代价,是把依赖换成了Prime Intellect这套更复杂的新中间层。

追平vLLM原生速度,HuggingFace的“免费”有几道门槛
Hugging Face宣布vLLM的transformers建模后端在Qwen3三种规模场景下追平甚至反超vLLM原生实现,靠的是运行时层融合技术。但这份“免费提速”只覆盖标准attention和规范代码,linear attention架构和非Qwen系模型的效果尚未被独立验证。

单摄像头打败多传感器?Mistral给机器人导航甩出76.6%成绩单
Mistral AI发布8B参数的Robostral Navigate,单靠一枚RGB摄像头、不用深度传感器和LiDAR就能听懂自然语言指令带机器人导航,在R2R-CE unseen基准上跑出76.6%成功率。官方给出的66.9%单摄像头基线和72.1%多传感器基线,让这次'领先'第一次有了可核验的量化坐标,但目前所有数字都来自Mistral自报,真实世界的碰撞率和第三方复现仍是空白。

ChatGPT传单席卷全球,都柏林酒吧、奥克兰场馆已经明令禁止
404 Media记者发现,从洛杉矶冲浪课传单到都柏林酒吧海报,ChatGPT生成的宣传物料正以统一视觉模板泛滥线上线下,都柏林Thomas House Bar和奥克兰一家场馆已明文禁止张贴AI传单。这场反弹的实质,是消费者赖以判断商家可信度的“用心程度”信号,正在被廉价复制到失灵。

新泽西这条法案没提LiDAR一个字,特斯拉却喊着被针对
新泽西一项自动驾驶法案要求全自动驾驶车配备摄像头加两种独立传感模态,条文里根本没出现LiDAR字样,但特斯拉已在官方游说页面把它定性为让自己“无法合法运营”的针对性立法。真正的悬念不是有没有激光雷达,而是这行模糊条款最终会不会给纯视觉方案留出合规空间。

GeoSQL自称提升4倍,实测样本只有3个案例
开源项目GeoSQL让Claude、Codex等agent学会写空间SQL并靠看地图纠错,官方称因此获得4倍性能提升,但支撑这个数字的评测集只有3个案例、8项断言,尚无第三方复现。放进CRS错配、几何有效性这些已知的空间数据老问题和CARTO等商业竞品的格局里看,它更像一次工程巧思的自证,而非成熟结论。

110亿估值背后:SambaNova融资曲线为何比英特尔报价快7倍
AI芯片公司SambaNova以110亿美元估值完成10亿美元Series F首轮融资,摩根大通同时宣布采用其SN40L和SN50系统做本地推理。这轮估值距英特尔去年12月约16亿美元的收购报价仅过去七个月,涨幅近7倍,而SN50的性能宣传至今没有独立跑分支撑。

经济学人用AI给自己打分:准确率不差,但裁判是自己
《经济学人》用GPT-5.5给本世纪7000篇社论打分,从中挑出约1400条可证伪预测,结论是立场适度的预测最准。但这套打分方法从样本到提示词全由自己一手操办,外界至今找不到任何独立复核。