人工智能资讯 第15页
聚合当前分类下的最新内容,按时间顺序查看第 15 页精选文章。

研究发现:错误AI建议让准确率跌到9%,自信心却冲上76%
法国、意大利三所大学的实验显示,参与者看到AI模型Step 3.5 Flash给出的错误建议后,准确率从27%跌到9%,愿意承认“不知道”的比例从44%降到3%,自信度却从30%冲到76%。就算后来给答对的人发钱,准确率也只回到16%,仍低于没有AI时的水平——问题不是AI会答错,而是它笃定的语气正在压低人们说“不知道”的意愿,这对AI搜索和教育产品是个具体警示。

黄仁勋东京两日:日本要AI主权,英伟达先拿下算力底座
黄仁勋两天内在东京官宣了国家级AI工厂、机器人生态和丰田合作三条线,日本的算力、机器人模型和车载软件几乎都要靠英伟达的芯片和Cosmos生态来跑。日本喊的是自主AI,但从Vera CPU到Jetson Thor,硬件层还没有替代选项,本土芯片项目Rapidus短期内接不上这一棒。真正该盯的,是Noetra的日语模型能否如期落地、机器人合作方几时有真实采购订单。

Netflix确认5.87亿美元收购价,阿弗莱克AI后期公司团队并入自家流程
Netflix在监管文件中确认,今年3月宣布收购的AI影视制作公司InterPositive,实际现金对价是5.87亿美元,阿弗莱克团队整体并入、本人转任高级顾问。这套工具的核心场景是补拍缺失镜头、换背景、修灯光,定位是后期修复,材料里没有证据支持它能替代导演或演员。Netflix称今年约300部作品用过生成式AI,说明的是渗透率在扩大,不是内容规模AI化,制片和后期团队现在要判断的是要不要跟着调整工具采购。

被标成AI生成的歌,好听靠的是人工剪辑
1010Benja新EP开场曲《Semiramis' Dream》被Deezer标为AI生成,但制作链路里真人节拍、真人演唱和Ableton人工剪辑占了大头,Suno只在中间加工两次。The Verge编辑难得说好听,可同一张EP另外三首不如他2024年的《Ten Total》,这套打法谈不上稳定可复制。

180天先发优势:华盛顿Robotaxi新规把Waymo和Uber推向对立面
华盛顿特区一份拟议的Robotaxi法案,让Waymo与Uber、Tesla公开站到了对立面。争议表面是测试门槛和费用高低,实质是监管红利归谁、以及未来的打车运力入口由谁说了算。

诺兰称AI是“透明木马”:好莱坞怕的不是技术,是动机
美国导演工会主席克里斯托弗·诺兰在《奥德赛》宣传期把AI比作“所有人都知道里面藏着希腊人的透明木马”。他的身份让这句话多一层重量——好莱坞的AI争议早已从“技术行不行”变成写进工会合同的“规则怎么定”。但他没有给出具体威胁的证据,判断更多来自舆论观察,而非调查数据。

4亿美元承诺与320万美元到账:Current AI能补上大厂留下的语言缺口吗
非营利组织Current AI已获4亿美元承诺资金,但首轮实际到账仅320万美元,分给四家机构。它推出的离线设备Suno Sutra和开源聊天机器人Alpha Chat证明了产品思路,却还没有用户规模和许可证细节支撑规模化。它想验证的是社区掌控数据的公共AI能不能长期活下去,而不是短期内替代OpenAI、Google、Anthropic。

Codex 0.144 上下文标注砍三成,是校准还是降级?
OpenAI 在 Codex 0.144 的一次元数据回补 PR 里,把上下文标注从37.2万token下调到27.2万token。PR本身没有变更说明,这更像是客户端对可用输入口径的一次重估,不是模型容量被砍。真正该盯的是长任务升级前后有没有提前触发压缩或截断,而不是这两个数字谁大谁小。

Qwen Studio 全面开放免费入口,但网传的"Qwen 3.8 Max"这次没出现
Qwen 官网新增 Qwen Studio 入口,把图像生成、深度研究、网页开发、联网搜索和多模态理解整合进同一个免费平台,还提供兼容 OpenAI API 格式的接口。但页面里找不到任何关于"Qwen 3.8 Max"的发布信息,传闻目前缺乏证据支撑。

Qwen3.8预告2.4万亿参数并将开放权重,部署成本才是关键
一则标注为2026年7月19日的预告称,通义千问将发布参数规模达2.4万亿的Qwen3.8并开放权重,预览版已进入Token Plan、Qoder和QoderWork。消息的含金量不取决于参数数字,而取决于权重能否下载、许可证是否允许商业部署,以及企业能否承担推理成本;这些关键信息目前仍未公布。

没用过AI的高管,却给年营收20亿美元的公司写了AI战略
一位企业咨询作者收集的匿名案例显示:某高管从没用过AI工具,却主导了一家年营收超20亿美元公司的AI战略;工程师靠AI批量改写代码库去刷token排行榜保工作;供应商不敢戳破客户口中的100倍生产率,怕丢合同。三件事拼在一起,暴露的是预算、职位、合同拼成的一整套激励设计。

多元微积分课上线:AI辅导,还是视频加聊天框
Academa 上线一套覆盖向量、偏导、多重积分与向量分析的多元微积分课程,视频页嵌入了 Feedback 和 Video Chat 两个按钮。目前只能确认聊天入口存在,看不到它是否绑定具体题目、能否纠错、有没有进度记忆。个性化辅导的分水岭在教学设计,不在多加一个聊天窗口。

transcribe.cpp:16 个语音识别家族塞进一个库,想补的不是模型,是信任
Handy 作者发布本地语音识别推理库 transcribe.cpp v0.1.0,号称覆盖 16 个 ASR 家族、60 多个模型,支持 Vulkan/Metal/CUDA/TinyBLAS 四种加速和四门语言绑定。它真正想补的是本地语音识别一直缺的分发和信任层,而不是模型数量本身。但性能、覆盖广度和校验结果目前主要来自作者自述,尚无第三方复现,长期维护也压在一个人身上。

纽约拟要求房东公开AI修图房源,2400人听证会催出的新规
纽约市政府7月16日发布《Rental Ripoff Report》,建议要求房东和经纪人披露房源广告中使用AI修改图片的情况,这是市长Mamdani走访五个行政区约2400名居民后交出的政策建议,目前还不是已生效的禁令。真正的变数在于披露规则如何落地、平台是否配合、以及远程租客能否真正核实图片与实景是否一致。

Kimi K3低价挑战Claude:一名开发者停订之后,真正该算哪笔账
一名开发者称,Kimi K3在日常编程中的体验已接近Claude,而帖文所列API价格约为后者的三成,因此决定停订Claude。单人体验不能证明模型全面赶超,但它暴露了更现实的变化:当代码能力差距缩小,闭源旗舰模型的价格、限额和工具生态都要重新接受比较。

六州试点AI审Medicare:真正该盯的,是承包商那笔'省钱分成'
CMS在六个州试点WISeR,用AI加人工复核审查原始Medicare的部分高风险项目,试点到2031年,不是全面自动拒付。真正该盯的不是AI审得准不准,而是承包商能从'避免支出'里分成,这层激励比技术本身更值得警惕。Medicare Advantage的历史数据显示,初审本就有一成以上错误、申诉撤销率高达81%,这次试点得先证明自己没把旧问题原样搬过来。

Fable 5 领先 GPT-5.6 Sol 1,875 分,赢面四比二的 /goal 反而拉低均分
一项基于未公开NP-hard光纤布线题的三轮配对测试显示,Claude Fable 5均分32,386分,领先GPT-5.6 Sol的34,261分,且波动更小。两者的持久化执行模式/goal在六次配对里赢下四次,均分却双双变差。这更像是放大搜索路径的开关,而不是纠错器,不该被开发者当成长任务的默认选项。

AI公司Logo集体撞脸:一个圆、一个洞、同一种安全感
OpenAI、Claude等多家头部AI公司的logo撞进同一套模板:圆形轮廓、中心开口、放射线条加柔和渐变,DeepSeek和Midjourney是原文列出的少数例外。设计评论把成因归到心理暗示、视觉错视、模仿效应和委员会决策,本质是行业在用视觉从众换取信任。真正该问的是,一批天天讲创新的公司,为什么在logo这件事上比谁都怕出格。

Fable 5留在Claude订阅里,但Anthropic只交出了一半额度
7月20日起,Claude Fable 5将进入Max与Team Premium套餐,但只有50%限额;Pro与Team Standard仍按用量积分访问,并获一次性100美元额度。Anthropic缓和了旗舰模型退出订阅的争议,却没有消除算力约束,只是重新分配了成本和使用门槛。

自曝精度超AlphaFold两倍,IsoDDE离新药还差几步
Isomorphic Labs发布药物设计系统IsoDDE,自称在蛋白-配体结构、抗体-抗原界面和结合亲和力三项基准上大幅超过AlphaFold 3和Boltz-2,还能仅凭序列找到一个被忽略15年的隐蔽口袋。所有对比数据来自公司自有技术报告,尚未见独立复现或临床验证。精度榜单领先,只是缩小了候选池,先导化合物优化、毒理和三期临床这几步,它还没真正碰过。

Vertu卖6880美元的AI高管手机,提醒时间能错出超过18小时
TechCrunch实测售价6880美元起的Vertu Alphafold:凌晨请求15分钟后提醒,Hermes却设到当晚9点08分,晚了超过18小时,商务行程日期也写错。硬件底层与1100美元的ZTE Nubia Fold高度相似,Vertu承认硬件平台和生产工程来自ZTE/Nubia供应链。真正该问的不是够不够奢华,而是一个还不稳定的AI agent能不能撑起给高管的数千美元溢价。