METAL LAB

腾讯Hy4预览版开源发布,编程基准测试超越GPT-5.6

腾讯表示,该模型在编程评测中超越了GPT-5.6,还参与了自身的训练与推理优化工作

모델 코드와 계산 흐름을 직조하는 대형 직기와 작업자

이미지: METAL LAB

摘要

  • 腾讯混元发布了开源大语言模型Hy4预览版,总参数7700亿个,激活参数490亿个,上下文窗口超过100万token。
  • 腾讯表示,该模型在SWE-bench Pro测试中取得65.7%的成绩,超过了GPT-5.6 Sol(64.6%)、GLM-5.3(64.6%)、Kimi K3(63.3%)和DeepSeek V4 Pro(60.3%)。
  • 腾讯还介绍称,该模型直接参与了自身训练方法和推理基础设施的优化过程,将处理吞吐量提升了31.8%。

腾讯混元开源发布的Hy4预览版参数规模庞大:总参数7700亿个,激活参数490亿个,上下文窗口超过100万token。腾讯表示,该模型在编程与软件工程基准测试SWE-bench Pro中取得65.7%的成绩,小幅超过了OpenAI的GPT-5.6 Sol(64.6%)和智谱AI的GLM-5.3(64.6%)。

腾讯的Hy4模型展示了一个循环结构,即模型直接参与自身训练方法和推理基础设施的优化过程,结果使处理吞吐量较基准提升了31.8%。腾讯的Hy4模型展示了一个循环结构,即模型直接参与自身训练方法和推理基础设施的优化过程,结果使处理吞吐量较基准提升了31.8%。

vLLM官方网站

此次发布正值中国开源大语言模型竞争白热化之际。此前8月18日,智谱AI公开了GLM-5.3的API,仅凭后训练就将其在Terminal-Bench上的得分从4.6提升到28.3;月之暗面(Moonshot AI)的Kimi K3DeepSeek的V4 Pro也已相继开源。

性能对比

除了SWE-bench Pro之外,腾讯还公布了自行开展的盲测评估结果。163名专家对203项实际工程任务进行了打分,在满分4.00分的评测中,Hy4预览版取得2.99分,略高于GLM-5.3(2.92分)和Kimi K3(2.94分)。需要指出的是,这两项评测数据均由腾讯自行测得。

基准测试Hy4 previewGPT-5.6 SolGLM-5.3Kimi K3DeepSeek V4 Pro
SWE-bench Pro65.7%64.6%64.6%63.3%60.3%
评测(满分4.00)Hy4 previewGLM-5.3Kimi K3
专家盲测评估2.992.922.94

腾讯在发布文中表示,这款模型"已跻身顶尖开源模型之列"

关于模型参与自身开发的说法

混元团队表示,Hy4预览版还直接参与了自身的开发过程。据介绍,该模型首次参与了训练方法、数据策略、评测框架以及底层算子自动化优化的工作,自主提出方法并进行实验,再将实验结果反馈到下一轮探索中,由此形成了一个处于早期阶段的递归式自我改进循环。

换句话说,腾讯表示Hy4预览版自主对自身的训练方法和推理速度进行了实验和改进,这意味着AI模型在没有人类研究者协助的情况下自行提升性能的递归式自我改进实验,正在业界刚刚起步。

腾讯还表示,该模型自行分析了自家推理系统的瓶颈,反复进行算子融合和通信优化,最终使端到端处理吞吐量较基准提升了31.8%。腾讯补充说,这一提升幅度在不同上下文长度和并发请求数量下都保持一致。

00 production quality hero airport

如何使用

Hy4预览版已可在编程智能体Cline中直接体验,也可通过腾讯的WorkBuddy、CodeBuddy应用以及元宝(Yuanbao)、ima应用访问。若要通过API接入,可经由腾讯云TokenHub或OpenRouter。

  1. 在Cline或CodeBuddy应用的模型列表中选择Hy4 preview。
  2. WorkBuddy、CodeBuddy自8月29日起提供两周免费使用,此前的Hy3模型免费使用期也延长至9月30日。
  3. 如需通过API直接接入,可通过腾讯云TokenHub或OpenRouter获取密钥并接入,费用为每百万输入token 0.834美元,输出token 2.501美元,缓存命中token 0.042美元。

腾讯表示,全球任何人都可下载这套开源权重并在自有服务器上运行,云端应用的访问渠道也已面向全球开放。腾讯举例说明的应用场景包括需要长上下文支持的调试与代码审查、跨文档、表格、演示文稿的办公任务,以及仅凭一次自然语言请求就能生成可玩游戏原型的开发工作。

据韩国国内媒体报道,腾讯云此前一直以实用型低成本AI而非顶级模型来开拓韩国企业市场,Hy4预览版的低API单价和开源发布,与这一战略方向是一致的。

编辑视角

中国开源阵营如今已经不再满足于用几个百分点的基准差距来证明自己追上了GPT级别的模型,而是开始让模型自己动手优化训练和推理基础设施。Hy4预览版关于自我改进循环的说法虽然还带有"处于早期阶段"的限定词,但把训练流程优化交给模型而非人类的实验,能够出现在实际产品发布文中,这本身就说明这股趋势已经走出了实验室。

从代际对比来看,也有值得玩味的地方。腾讯一边把上一代Hy3的免费使用期延长到9月30日,一边又让新品Hy4开放两周免费试用,这种做法清楚地体现了"预览优先"的策略——把真实用户的反馈直接纳入下一轮训练。先以预览版形式推出、再通过正式版打磨完善,这并非混元第一次这么做,而是它反复采用的一种模式。

从实用角度看,有两点需要分开来看。一是基准数据本身:SWE-bench Pro和内部盲测评估的结果都是腾讯自行测得的,在得到独立验证之前,这一点需要留意。二是价格:每百万输入token 0.834美元的费用,对于需要长期高频运行编程智能体的团队来说,是能实实在在降低成本的水平,值得通过Cline或CodeBuddy接入实际工作流后再做判断。

由于腾讯已预告"Hy4系列的下一批次即将推出",几周内很可能会出现正式版或后续预览版。眼下与GLM-5.3、Kimi K3之间的基准差距已经缩小到1至2个百分点左右,下一轮的看点恐怕不再是数字上的较量,而是自我改进循环究竟成熟到了什么程度。

评论