人工智能资讯 第60页
聚合当前分类下的最新内容,按时间顺序查看第 60 页精选文章。

DeepSeek V4 Flash冲上性价比前排,但高推理档才是真考题
DeepSeek V4 Flash以3040亿参数和低价进入Artificial Analysis性价比前排,榜单表现甚至超过参数更大的MiniMax M3。但一次绘图测试显示,默认与高推理档的结果差距明显;在延迟、实际Token消耗和报价渠道核清之前,它更像一款值得测试的低价模型,而不是已经坐实的性价比冠军。

模型评测别只看大厂榜单:这个开源工具想把它变成工程日常
Simon Willison和Prime Radiant开源了smevals,用几份YAML文件搭评测套件,run和grade彻底分开,评分标准随时能换着重跑。它测的是模型+提示词+agent harness的组合表现,不是通用能力排名。工具是作者第三次迭代,评分器本身仍是整套流程的天花板。

Kimi K3逼近闭源前沿,开放权重模型仍卡在部署与责任边界
2026年7月下旬,Simon Willison在Oxide and Friends播客中讨论Kimi K3、美国开放权重政策倡议及近期AI安全事件;节目上线前,DeepSeek V4 Flash 0731和Anthropic相关安全事件又改变了讨论背景。能力差距确实在缩小,但开放权重尚未解决许可证、部署成本、可靠性和事故责任,企业换模型不能只看排行榜。

Google Earth接入AI生图一天就叫停,问题出在“地图”两个字上
Google Earth周四接入Nano Banana 2生图功能,允许用户把虚构画面叠加到真实卫星地图上,不到24小时就因造假风险被叫停。争议核心不是AI会不会造假,而是伪造内容借用了Google Earth多年积累的核证信用。Google承认已有疑似违规截图,回滚后仍在观察护栏怎么补。

yc-software开源QM:AI Agent升级的关键不是换模型,是分权限
yc-software在GitHub开源了MIT许可的多人协作Agent框架QM,支持Slack和Web,允许个人与协作空间分别拥有独立权限、记忆和沙箱。它的卖点不是能换模型,而是把企业级Agent的身份和执行环境按人和房间切开,部署和安全责任仍留给采用它的初创公司自己。

三大唱片公司提案:AI歌曲要上榜,先过'人类主导'关
环球、索尼、华纳等唱片公司联合提出全球性AI歌曲榜单资格原则,要求作品实质由人类创作、AI工具合法授权才能上官方榜单,IFPI已表态支持。截至发稿没有一家榜单机构宣布采纳,'实质由人类创作'也没有统一标准。这更像唱片业向平台施压划线,而不是已经生效的规则。

Snapchat收紧Spotlight:全AI视频失去推荐资格
Snapchat从7月31日起,把纯AI生成的视频挡在Spotlight推荐池外,AI辅助剪辑真人素材不受影响。这是Snapchat半年内第三次收紧Spotlight,治理重心从提前预警转向直接掐流量入口。官方还没公布识别标准、申诉渠道,也没说清对创作者收入的实际影响。

DeepSeek V4 Flash 评测页搭好了,分数栏还空着
Artificial Analysis为DeepSeek V4 Flash 0731(max)建了完整评测框架,覆盖智能、幻觉、成本、上下文和参数规模,但分数、价格、参数量全部空白。多数模型发布时跑分和定价是同步放出的,这次框架先行、数据挂空,顺序少见。开发者选型和成本预算现在还下不了手,只能先按现有模型报价,别被“Flash”这个名字带节奏。

Google Earth真实卫星图里,AI能凭空画出袭击现场
据404 Media报道,Google Earth网页版新增由Nano Banana模型驱动的生成式图像功能,用户在真实地理底图上输入提示词即可合成袭击、难民营、核设施等虚假场景。真正的风险不是底图被篡改,而是生成式编辑与真实影像挤在同一个界面里,OSINT核查从此不能只信一张Google Earth截图。

AI能拿奥数金牌,却可能编不出自己的解题过程
推理模型确实拿到了IMO金牌级战绩,也啃下了几道数学悬案,这一步是真的;但多项研究发现,把它写出来的思考步骤删掉三到六成、甚至换成错误内容,答案照样对,说明思维链未必忠实记录了内部计算过程;能算对题和能审计它怎么想,是两件不同的事,厂商的类人推理叙事目前还撑不住这道坎。

电梯调度的反常识:规则越复杂,高峰期未必等得越短
一套电梯调度模拟显示,高流量或少梯组场景中,简单的 LOOK 可能比每 5 秒重算一次的 RSR 更快;目的层派梯也只在超高层、大梯组等部分条件下占优。真正决定候梯体验的,不是系统掌握多少信息,而是客流变化后还能否及时改派和纠偏。该结果只来自模拟,不能直接当成所有楼宇和厂商系统的实测结论。

耶鲁AI作弊案打成13项联邦诉讼:争议焦点从检测器滑向一份迟到的文件
耶鲁一名EMBA学生因期末考卷被指用AI代写、迟迟不交原始文件,遭停学判F,随后以13项诉因把母校告上联邦法院,打到2026年仍未开庭。真正让案件失控的,不是AI检测器判得准不准,是他面对反复索要底稿时沉默了数月。这提醒的是同一件事:技术证据靠不住时,程序和配合本身就成了证据。

1300万美元融资押注延迟:语音AI的下一关不是像不像人
语音AI公司Smallest.ai完成1300万美元A轮融资,累计融资超过2100万美元,押注小模型顶前线、大模型管复杂问题的双引擎架构。转接停顿有多长、口音识别准不准,公司都没给出实测数据,商业化目前只能算“有客户”。

曝光9天后,ISBNdb删除AI购书页面并改口:只是一次“需求测试”
图书数据公司ISBNdb在404 Media曝光其“为AI公司采购扫描纸质书”的营销页面后,9天内删除页面并改口,称从未购买、扫描或出售过书,那只是一次“市场需求测试”。但书商反馈的异常批量订单没有随页面一起消失,真正的问题也不是ISBNdb扫没扫过书,而是AI行业对“干净纸质文本”的胃口正把版权与二手书交易之间的灰区变成生意。

240万美元预付款报价被撤:一场AI代写疑云,逼作者自证'我写的'
一部新人小说在出版社竞价中报出240万美元预付款,随后因编辑怀疑文本出自AI而被撤约,书稿来源至今没有独立信源坐实。科幻作家Hugh Howey据此判断:出版变便宜用了不到十年,写作本身也可能被批量生成,以后作者得自证'这真是我写的'。这套推测目前更像行业焦虑的一次集中爆发,还谈不上已经验证的规律。

苹果新版《恐怖角》:老仇人这次不用刀,用无人机和AI
Apple TV把《恐怖角》改成10集剧,Max Cady服刑17年靠他人认罪出狱后,转而用无人机和AI折磨当年的辩护律师Anna与检察官Tom。三代改编换了三次复仇工具,这次换的是最容易被信任的日常技术。

私募信贷的Excel账本没换,Ryan Williams的AI代理先接进去了
Cadre联合创始人Ryan Williams的新公司Ellis AI拿到1000万美元种子轮,想用AI代理接管私募信贷基金的对账和月末结账;它不换基金现有系统,只负责接进去、标差异,重大决策仍留给人;真正的门槛在审计留痕和责任归属,不在种子轮的投资人阵容。

97%员工用上ChatGPT,Univé押注的不是工具而是人
荷兰保险公司Univé把ChatGPT Enterprise许可证激活率做到97%,员工自建约1500个定制GPT,宠物险理赔材料准备从数小时压缩到几分钟。这些数字来自企业自述,成本、错误率、实际回报仍未披露。真正值得同行学的,是治理先行、员工自建这条组织路径,而不是激活率本身。

OpenAI向欧盟摊开安全账本:主动合规,也在争夺规则解释权
OpenAI公开其模型安全、外部评测、内容溯源和网络安全措施,并表示支持欧盟GPAI实践准则及AI生成内容透明度实践准则。对欧洲企业和开发者,这意味着采购、部署与留证流程都要调整。我的判断是:主动合规值得肯定,但企业自述不能代替监管验收,技术优势也不该自动兑换成规则解释权。

DeepSeek V4-Flash公测:架构没换,官方喊'远超Pro'却没给对照分数
DeepSeek把V4-Flash API推入公开测试,同一套架构只做了一轮后训练,新增Codex原生适配;官方跑分数字好看,但没给出V4-Pro-Preview的对照分数,且升级只覆盖API,V4-Pro和APP端都没变;企业迁移和采购决策还得等价格、延迟和真实项目数据。

你保存的AI对话记录,正在变成供应商数据库里的一个指针
主流推理API正把推理过程、检索证据、上下文压缩和多智能体通信封装成只有供应商能读的私有状态,用户导出的记录只是残缍的一角。加密防的是客户端读取,不是防供应商读取,这不等于阴谋,但客观效果确实是锁定。真正该盯的是:换个供应商时,你手里的记录够不够自解释、能不能被接手。