人工智能资讯 第34页

聚合当前分类下的最新内容,按时间顺序查看第 34 页精选文章。

DOJ为OpenAI训练AI辩护,但只护住了一半责任
人工智能 2026/9/3

DOJ为OpenAI训练AI辩护,但只护住了一半责任

美国司法部9月1日在纽约南区法院就OpenAI版权案提交20页意见陈述,力挺AI训练适用合理使用原则;但文件明确把训练、数据获取、模型输出三件事分开谈,并未说训练材料的使用全部合法,这条边界恰恰是下一轮诉讼最容易被攻破的地方。

AI训练合理使用OpenAI
0.0041%假阳性率背后:AI检测正在放弃“真假”二分法
人工智能 2026/9/3

0.0041%假阳性率背后:AI检测正在放弃“真假”二分法

Pangram联合创始人Max Spero在访谈中点出一个技术转向:AI检测正从“是不是AI写的”二选一,变成判断“AI参与了多少”的光谱分类,其新模型Pangram 4的官方基准和第三方研究部分印证了这套思路,但假阳性风险仍不成比例地压在ESL和神经多样性写作者身上。

AI检测PangramPangram 4
死亡帽识别率仅46%,AI认蘑菇的高分背后藏着什么
人工智能 2026/9/3

死亡帽识别率仅46%,AI认蘑菇的高分背后藏着什么

Quesma团队用1,040张真实蘑菇照片测试16个多模态大模型,Gemini 3.6 Flash综合准确率最高且比多数frontier模型更便宜,但死亡帽等致命物种的识别率只有46%,17%被误判成可食用近似种。整体跑分越漂亮,越容易掩盖这类致命型错误,这才是真正该盯的风险。

多模态大模型蘑菇识别Quesma
纽约州长候选人用AI合成曼达尼与霍楚尔,争议不只在画面诡异
人工智能 2026/9/3

纽约州长候选人用AI合成曼达尼与霍楚尔,争议不只在画面诡异

纽约州共和党州长提名人发布AI视频,把佐赫兰·曼达尼与凯茜·霍楚尔放进近似处方药广告的场景。它未必能让观众相信某件事真实发生,却能低成本制造政治关联;判断争议大小,还要看标签、投放范围和传播数据。

AI选举视频生成式人工智能选举披露法
IBM把预测模型塞进Confluent数据流,省的是搭建不是判断
人工智能 2026/9/2

IBM把预测模型塞进Confluent数据流,省的是搭建不是判断

IBM与Confluent宣布把四款Granite时间序列基础模型接入Confluent Cloud,企业可以用Flink SQL直接调用做预测和异常检测,目前仅限Early Access且先在AWS开放。真正该看的不是模型多新,而是流内推理能否把部署成本降到企业愿意为长尾场景买单的程度。

IBMConfluentGranite时间序列基础模型
Claude突然不背歌词了,三天前它刚被索尼华纳告上法庭
人工智能 2026/9/2

Claude突然不背歌词了,三天前它刚被索尼华纳告上法庭

Anthropic给Claude Fable 5.1加了一大段拒绝复现歌词、诗歌、版权角色的系统提示词,时间点紧贴索尼音乐出版和华纳查普尔起诉Anthropic的诉讼。这层护栏只管claude.ai网页和App,不管开发者调用的API,更像是给消费端产品套的一层免责话术,训练数据源头的官司还没真正开打。

ClaudeAnthropicFable 5.1
三个网站造出21万篇'最佳软件'页,Perplexity照单全收
人工智能 2026/9/2

三个网站造出21万篇'最佳软件'页,Perplexity照单全收

研究机构Trellner用760次调用测试Perplexity的sonar系列模型,发现近六成引用来自Tranco排名10万位之外的冷门域名,其中三个疑似同一运营方的站点用18篇博客撑起21万篇AI生成的'最佳软件'页面,还把首页标题直接写成'Facts & Grounding Page'。这不是老套的内容农场刷排名,而是专门针对AI检索机制设计的定向投喂,目前只证实对Perplexity生效。

PerplexityAI检索操纵sonar系列模型
Cybercab 在奥斯汀公开载客:特斯拉的摄像头路线迎来现实检验
人工智能 2026/9/2

Cybercab 在奥斯汀公开载客:特斯拉的摄像头路线迎来现实检验

2026年9月,特斯拉在得州奥斯汀启用搭载改版 FSD 的 Cybercab 公开载客,车辆没有方向盘,并由远程操作员监控。服务启动只能证明特斯拉开始进入真实运营,尚不能证明其摄像头方案已经实现完全无人驾驶;安全冗余、远程介入和事故责任才是接下来要核验的核心变量。

TeslaCybercab自动驾驶
从7起到37起:OpenAI的Tumbler Ridge官司,'协助教唆'这顶帽子扣得住吗
人工智能 2026/9/2

从7起到37起:OpenAI的Tumbler Ridge官司,'协助教唆'这顶帽子扣得住吗

Edelson PC本周在加州追加30起诉讼,把针对OpenAI的Tumbler Ridge枪击案诉讼总数推高到37起,并首次指控OpenAI'协助教唆'而非单纯疏忽。这个诉因法律门槛极高,原告自己也承认关键指控只是'信息与推测';真正致命的,是OpenAI案发前后对同一份聊天记录给出两套相反的风险判断标准。

OpenAITumbler Ridge枪击案人工智能安全
IFA机器人秀场调查:号称六台人形,过半不是双足
人工智能 2026/9/2

IFA机器人秀场调查:号称六台人形,过半不是双足

IFA柏林机器人走秀阵容里,过半参展方展示的其实是可变形四足、工业四足或陪伴型机器人,并非严格意义上的双足人形;LG CLOiD训练数百台机器人构建机器人基础模型的故事,也并非本届IFA官方发布内容。这说明‘人形机器人逼近家庭’的叙事被媒体简化放大了,真正瓶颈仍是能在混乱环境里自主决策的调度大脑,而不是一双腿。

人形机器人IFA柏林机器人基础模型
AI审核AI临床笔记:查得出乱写,查不出漏写
人工智能 2026/9/2

AI审核AI临床笔记:查得出乱写,查不出漏写

一份新预印本用500组笔记构建的OmissionBench基准显示,负责审核AI临床笔记的LLM评审模型,能可靠识别“多写、错写”,却几乎查不出“漏写”,判别力接近随机猜测。配套的真实世界普查更扎心:同一批笔记换一套审核指令,验证出的错误比例能从9.3%飙到79%,说明行业现在拿出来的AI笔记错误率数字,脱离审核方法谈都不完整。

OmissionBenchAI临床笔记LLM评审模型
18万行代码写完了,审查却卡住了:Claude替WINE重写了Direct2D
人工智能 2026/9/2

18万行代码写完了,审查却卡住了:Claude替WINE重写了Direct2D

Paint.NET作者Rick Brewster让Claude从零逆向重写了一套Direct2D替代实现,约18万行代码,专供WINE环境下的Paint.NET使用,通过/wine参数触发。作者坦言这些代码基本没被认真审查过,是典型的“vibe coded”,这恰恰说明AI编程真正的瓶颈已经从能不能写,变成了谁来审、谁担责。

AI编程Claude代码审查
Datasette的MCP插件转正,一个数据结构改动救了谁的命
人工智能 2026/9/2

Datasette的MCP插件转正,一个数据结构改动救了谁的命

Simon Willison发布datasette-mcp 0.2,首个正式版把execute_sql返回的行数据从数组的数组改成对象数组,专门解决弱模型对不上列名的老毛病。这次改动不大,但暴露出AI agent接数据库这件事,工程重心正从“能跑通”转向“迁就模型弱点、补上权限漏洞”。

datasette-mcpDatasetteMCP
神经网络里到底藏没藏着符号结构?一篇新论文只敢说"接近"
人工智能 2026/9/2

神经网络里到底藏没藏着符号结构?一篇新论文只敢说"接近"

8月30日提交arXiv的论文(编号2608.29530)显示,把神经网络的向量表征换成符号结构闭式方程,模型行为基本不变;对LLM内部表征做定向干预,还能按预期改变输出。这提供了一条连接连续向量和符号结构的实验路径,但离证明神经网络本质是符号系统还差得远。

神经网络大语言模型符号结构
LLM推理的“效率前沿”:一套人人在讲、谁都没验证的说法
人工智能 2026/9/2

LLM推理的“效率前沿”:一套人人在讲、谁都没验证的说法

Baseten用“效率前沿”把batch sizing、并行策略、量化、推测解码等推理优化手段分成两类,还甩出KV路由带来2倍TTFT提速的案例;但这套框架缺可复现基准,Google Cloud几乎同期发布了同类文章,说明这更像行业通用话术而非独家洞见。

LLM推理优化效率前沿Baseten
AI帮你画了条社区边界线,但这条线可能压根不存在
人工智能 2026/9/2

AI帮你画了条社区边界线,但这条线可能压根不存在

Simon Willison用GPT-5.6-Sol、Claude Code、Fable三个AI接力做出一个GeoJSON地图查看导出工具,又用ChatGPT从政府数据源拼出社区边界数据。工具本身是扎实的工程活,但拼出来的边界未必有法定几何依据,咨询性社区委员会的'边界'很可能只是AI对社区名称的推断。

AI辅助开发社区边界数据可靠性GeoJSON
10美分到3.3美元:Claude Fable 5.1的骷鹕测试,拆出三处水分
人工智能 2026/9/2

10美分到3.3美元:Claude Fable 5.1的骷鹕测试,拆出三处水分

Simon Willison用同一句提示词测试Claude Fable 5.1的五档推理强度,价格从10美分跳到3.30美元,画质提升却极不均匀,低档位甚至没启动推理。同一天Anthropic自报的52.6%科研基准分数,和这个基准公开榜的历史数据也对不上。骷鹕测试还能不能当真,和跑分能不能当真,成了同一个问题。

Claude Fable 5.1AnthropicSimon Willison
48GB内存Mac mini本地跑大模型,能顶掉多少云端订阅费
人工智能 2026/9/2

48GB内存Mac mini本地跑大模型,能顶掉多少云端订阅费

一位开发者用48GB内存的M4 Pro Mac mini跑两个本地模型,接管了原本靠两笔200美元月费订阅(合计400美元/月)处理的日常请求。关键不是内存占用被砍到活跃参数那么小,而是MoE架构把推理时的计算量降下来了,内存这本账主要还是看总参数量。这套方案能扛住约八成轻量任务,顶级推理仍要回云端,复制它对经常跑满订阅额度的开发者更现实。

本地大模型MoE架构Qwen3.6-35B-A3B
Google开价4000万美元一个角色,想买的其实是好莱坞的信任
人工智能 2026/9/2

Google开价4000万美元一个角色,想买的其实是好莱坞的信任

据《洛杉矶时报》8月31日报道,Google正接触迪士尼、华纳兄弟探索和环球,谈AI训练与角色生成的版权许可,三家均未签约。单角色报价约4000万美元,扩展到整条阵容可能滚到数十亿美元。这笔钱买的是Google急缺的合规许可,制片厂要算的是训练权、生成权、分成和创作者权益的四层账,议价权未必在出价更高的一方。

GoogleAI训练版权授权
Claude Fable 5.1 的“降价45%”:便宜的是缓存命中,不是所有调用
人工智能 2026/9/2

Claude Fable 5.1 的“降价45%”:便宜的是缓存命中,不是所有调用

Anthropic称,Claude Fable 5.1通常比Fable 5便宜约25%,复杂智能体任务最高可省45%,关键来自缓存数据费率下调。这个数字对反复调用长上下文的编码团队有吸引力,但不能直接等同于整张账单下降45%;输出费用、缓存命中率、保留策略和实际效果仍决定它是否真划算。

Claude Fable 5.1Anthropic大语言模型定价
YC史上最快独角兽,却是一轮"查无此人"的融资
人工智能 2026/9/2

YC史上最快独角兽,却是一轮"查无此人"的融资

AI训练数据公司AfterQuery据传五个月内估值从3亿美元冲到32亿美元,成为YC史上最快独角兽,但两家报道该消息的媒体都未能确认领投方身份,公司本人也拒绝置评。这轮估值背后,收入口径模糊、客户集中度高、专家网络口碑分裂,都是比"最快"这个头衔更值得盯住的变量。

AfterQueryAI训练数据融资与估值