腾讯在8月28日发布并开源了混元Hy4 preview。这款模型总参数7700亿,激活参数490亿,上下文窗口超过100万token,同步接入WorkBuddy、CodeBuddy、元宝、ima四条产品线,也能直接调API。
这次发布的重点不是参数又堆高了一级。腾讯把这轮竞争直接压到了写代码、做表格、跑分析这类具体生产力场景里,产品先落地,评测数据紧接着补上。
内部盲测赢0.05分,离“第一梯队”还有多远
腾讯给出的核心证据,是一场自己组织的盲测:163名内部专家,203项工程任务。Hy4 preview得分2.99(满分4.00),Kimi K3得2.94,GLM-5.3得2.92。
三个分数挤在0.07分区间里。这更像打平,谈不上压制性领先。
评测由腾讯自己设计、自己出题、自己找专家打分,没有第三方机构复核。官方通稿里“跻身开源模型第一梯队”的说法,目前只是腾讯自己的判断。
腾讯还提到,Hy4 preview参与了自身训练方法和底层算子的优化,推理吞吐效率提升31.8%。材料里把这称为“早期递归自我优化尝试”——是尝试,不是成熟的自我进化能力。这个31.8%也是相对腾讯自定的基线测出来的,没公开硬件、并发和测试配置,不能拿去和别家的优化幅度直接比较。
对开发者来说,这些分数还不构成换模型的理由。0.05到0.07分的差距,换不来对生产力工具的信心,能验证的只有一件事:这轮腾讯确实在追,但还没拉开身位。
该看价格和开源完整度,不是跑分
普通用户和开发者有个低成本入口:CodeBuddy、WorkBuddy两周免费体验,老版本Hy3的免费期延长到9月30日。适合先用起来,自己判断顺不顺手。
要接API的企业和开发者,真正该算的是成本和迁移代价。
| 计费项 | 单价(每百万token) |
|---|---|
| 输入 | 0.834美元 |
| 输出 | 2.501美元 |
| 缓存命中 | 0.042美元 |
价格不算贵。但7700亿总参数的模型,私有化部署门槛不低,中小团队大概率还是走API或产品内嵌,不会自己拉权重跑推理。
“开源”这两个字也需要打问号。官方通稿只说了开源,没交代权重格式、推理代码、许可证条款是否完整公开。这决定了第三方能不能真正复现和改造这个模型,还是只能调用一个云端接口。
两类读者,现在该做的事不一样:
| 读者 | 现在该做什么 |
|---|---|
| 评估代码/办公智能体的开发者 | 用两周免费期跑一遍团队真实任务,重点看超长上下文下的稳定性 |
| 负责选型和API预算的技术决策者 | 先别签迁移合同,等许可证和权重细节公开再算总拥有成本 |
接下来该盯的三件事:开源仓库的许可证细节什么时候公开,第三方独立评测什么时候出来,100万token上下文在真实长文档任务里到底能不能稳定用。
