开云kaiyun登录入口登录APP下载(中国)官方网站-开云体育(中国)官方网站Hy3郑再版官方公布的12项评测维度-开云kaiyun登录入口登录APP下载(中国)官方网站

开云体育(中国)官方网站Hy3郑再版官方公布的12项评测维度-开云kaiyun登录入口登录APP下载(中国)官方网站

发布日期:2026-07-24 08:03  点击次数:155

开云体育(中国)官方网站Hy3郑再版官方公布的12项评测维度-开云kaiyun登录入口登录APP下载(中国)官方网站

7月6日,腾讯混元Hy3郑再版悄然上线。距离4月23日Hy3 preview开源发布,整整两个半月。

在参数鸿沟上,Hy3 不息了 Preview 版块的既定道路:总参数目 295B,激活参数目 21B,罗致 MoE 搀和大家架构。

算作对比,咫尺行业第一梯队中,国表里头部模子的总参数目则普遍迈向了 T 门槛。Hy3 保管 295B 参数鸿沟,与 DeepSeek V4 Flash 和 MiniMax M3 接近。

更显着的克制体咫尺凹凸文窗口上。在动辄 1M 险些成为行业标配、各大厂商纷繁以此彰显时刻肌肉确当下,Hy3 郑再版依然将窗口停留在 256K。

咫尺来看,Hy3 郑再版的改造主要聚焦于推理才智、教唆死守、Agent 践诺和幻觉收尾。在长文本容量未作念跨代升级的前提下,腾讯的中枢逻辑显着是压榨既有容量的性能极限,让它在有限的凹凸文窗口内,在更复杂、更逼近真确责任流的任务中尽量少出错。

Hy3郑再版官方公布的12项评测维度,横向对比模子包括GLM-5.2、DeepSeek V4 Pro、Qwen 3.7 Max、Seed-2.1 Pro、GPT-5.5和Claude Opus 4.8。

代码与软件工程维度:

1. SWE-bench Multilingual(多谈话软件工程基准):75.8分。逾期于Claude Opus 4.8(84.4分)和GLM-5.2(83.0分),但优于DeepSeek V4 Pro和Qwen 3.7 Max。

2. SWE-bench Pro(专科级软件工程基准):57.9分。大幅逾期于Claude Opus 4.8(69.2分)和GLM-5.2(62.1分),但高于DeepSeek V4 Pro(55.4分)。比拟preview版块的46.0分,莳植幅度高出25%。

3. Terminal Bench 2.1(终局大叫践诺基准):71.7分。位列第四,逾期于Claude Opus 4.8(85.0分)、GLM-5.2(81.0分)和Qwen 3.7 Max(75.0分)。

4. NL2repo(当然谈话转代码仓库):45.6分。中拍浮平,逾期于Claude Opus 4.8(69.7分)和GLM-5.2(48.9分)。

Agent与器用调用维度:

5. ClawEval(Agent框架践诺):68.5分。弘扬亮眼,仅次于Claude Opus 4.8(72.1分),高出DeepSeek V4 Pro(62.4分)和Qwen 3.7 Max(65.2分)。

6. MCP Atlas (public)(MCP器用调用测试):79.1分。在提供数据的6个主流模子中排行末位,逾期于Claude Opus 4.8(84.1分)、GLM-5.2(82.6分)及Seed-2.1 Pro(80.6分)。

7. SkillsBench (text-only)(技能基准-纯文本):55.3分。preview版仅29.1分,郑再版莳植近90%,位列第二,仅次于Claude Opus 4.8(64.6分)。

搜索与信息检索维度:

8. BrowseComp(网页浏览抽象才智):84.2分。与GPT-5.5(84.4分)险些持平,是Hy3弘扬最强的单项之一。

9. AA-LCR(高等逻辑与长凹凸文推理):73.4分。与GLM-5.2(73.4分)比肩,逾期于GPT-5.5(76.4分)。

STEM与推理维度:

10. GPQA Diamond(博士级科学问题):90.4分。接近GPT-5.5(93.6分),在国产模子中弘扬凸起。

11. HLE (with tools, text-only)(硬逻辑评估-带器用):53.2分。低于GLM-5.2(54.7分),高于DeepSeek V4 Pro(48.2分)。

12. MathArena Apex(数学竞赛竞技场):38.7分。preview版仅12.8分,郑再版结束207%的”袭击性反弹”,在原土竞品中仅次于Qwen 3.7 Max(44.5分)。

从整张获利单来看,Hy3 郑再版展现出了典型的“求实偏科”特征。

在前沿科学推理和特定 Agent 践诺维度(如 ClawEval、SkillsBench)上挤进了行业头部;但在磨砺生态落地、器用调用的关节方针(如 MCP Atlas)以及极硬核的软件工程真确赛谈(如 SWE-bench Pro)中,距离外洋顶级模子和国里面分头部竞品仍存在一定位差。

姚顺雨在加入腾讯前一年发表的博客著作《The Second Half》中,依然系统阐释了这套念念路。他以为AI的”配方”已基本成型,大鸿沟谈话预西席、数据与算力的鸿沟化、推理,上半场依赖”设立新设施打败基准测试”的游戏章程正在失效,下半场AI驱动转向”真确寰宇效率问题”。

Hy3的架构选拔,正是这种”实用主义AI”理念的时刻投射。

长板:Agent闭幕与编程审好意思

Hy3的三个高分维度:BrowseComp(84.2分)、AA-LCR(73.4分)、ClawEval(68.5分),指向了一个共同的才智特征:对既有信息的精确定位、筛选与整合。

这三个高分维度的共性在于,它们锻真金不怕火的是”在广袤信息中找得到、筛得准”的实用技能。BrowseComp上仅差GPT-5.5 0.2分,意味着Hy3在复杂的网页导航和多源信断绝叉考证任务中,依然具备了接近顶流的容错才智;

AA-LCR与GLM-5.2比肩,证据其在长文本的逻辑推理上至少站稳了第一梯队;ClawEval紧随Claude位列次席,则标明其在真确寰宇Agent任务中的践诺才智得到了初步认同。

这种才智特征被径直转变到了腾讯的产物矩阵中。元宝的长文本风雅、ima的学问库问答(Agent系统沉稳性达95.1%,推理质地净莳植近19%)、腾讯文档的智能分析——这些高频办公场景适值最需要”信息精确定位”而非”算法灵光一闪”。

更值得存眷的是Hy3在编程Agent领域展露的”审好意思功底”。

左证孤苦评测东谈主「赛博史官」的实测反映,Hy3郑再版在编程任务中不仅能生成可运行的代码,还在UI假想、图标渲染、视觉建模等细分维度上作念到了国产大模子中的拔尖水平。

但这条长板也伴跟着一个心事的秉性瑕玷:Hy3的主动阐述倾向极强。面临需求污秽的用户,这种”主不雅能动性”能带来极大惊喜——它会主动补全你莫得说出的需求;但当工程需求抵制极其了了硬核时,过于活跃的”主不雅能动性”又可能显得不受抵制、不够克制。

在教唆死守才智上,测试露出Hy3显着强于同尺寸的DeepSeek-V4 Flash,在需要深度意会力的教唆上以致不错看皆DeepSeek-V4 Pro。但这并非免费的午餐,Hy3在这类任务上的Token花消比DS4 Flash骤增了50%到150%。

短板:暴力、幻觉与冷门时刻栈

要是说长板让Hy3站稳了脚跟,那么短板则勾画出它仍需攀爬的坡度。值得细目的是,从preview到郑再版,Hy3在12个维度上沿途结束了正向增长,部分前期低分项的反弹幅度号称惊艳。但将视角拉高到大家竞争的坐标系中,几个显性的才智缺口依然值得存眷。

数学推理是差距最为集结的维度。 MathArena Apex上的38.7分比拟preview版的12.8分完成了近三倍的跃升,这一逾越自己已足以体现团队在后西席阶段的用劲之深。但横向来看,GPT-5.5的85.4分仍然像一面镜子,照出了国产模子在纯数学推理上的集体瓶颈。Hy3在经管复杂数学问题时对Token花消量较大,更倾向于通过充分的推理步数来交流准确率的莳植,这在工程上是一种求实的衡量,但也意味着在臆度打算资源受限的场景下,其数学才智会有所折损。

MCP Atlas的79.1分,是郑再版获利单中相对薄弱的一环。 MCP(Model Context Protocol)算作刻下Agent生态的事实圭表,其器用调用才智径直影响模子在多器用合作场景中的绽放度。Hy3在这一项上不仅低于Claude Opus 4.8(84.1分)和GLM-5.2(82.6分),也略逊于Seed-2.1 Pro(80.6分)。这一数据与部分实测反映造成了互证:在单器用、可控环境里,Hy3大概输出漂亮的交互网页;但在需要跨多个器用畅通合作的复杂责任流中,其在接口认证、十分经管等身手的容错才智仍有打磨空间。

卡位:账单博弈与禁闭生态的围城

从 Preview 到郑再版,Hy3 在 12 个维度上迎来了全面高潮。

但拆解其增幅中位数不错发现,高增长在很猛经过上是由 MathArena 和 SkillsBench 等前期低分项的袭击性反弹拉动的。这种“足够式补短”计策极为求实,它让模子在最短时候内完成了工程化编削,但也从侧面坐实了预览版曾存在的结构性瑕玷。将 Hy3 放入国内主流竞品的坐标系中,其抽象弘扬永恒在均值凹凸进行 1 到 3 分的微小波动。这意味着国内大模子第一梯队依然干预尖锐化的胶著期,选 Hy3 照旧选 GLM,取决于业务的具体场景,而非模子皆备才智的云泥之别。

在生意竞争中,腾讯这次祭出了极具攻击性的“降维卡位”订价:输入 1 元/百万 tokens、输出 4 元/百万 tokens,而缓存掷中更是探到了 0.25 元。这一策略径直在行业中撕开了一个私有的生态位。它固然不与极致价钱战的轻量模子拼地板价,但面临智谱高阶模子或 Qwen3-Max 等同级别旗舰竞品时,其单价仅为敌手的几分之一。

这种轻量级账单的背后,隐匿着一套极其心事的动态算力博弈。

其上风在于特定场景下“高践诺闭幕”的乘数效应。在长文本风雅或文件检索等皆备上风区,Hy3 凭借缩减 30% 的步数与器用调用数,结束了物理层面的 Token 瘦身。低单价与低花消双重红利访佛,使得企业在这些高频业务场景下的内容算力支出呈现断崖式下降。 然而,其劣势也在短板场景下内情毕露。在需要跨平台 Agent 合作或硬核代码重构的区域,由于短缺算法直观,Hy3 极易堕入由普遍盲目试探、Debug 组成的“Token 黑洞”,单价上的低廉会被猖獗飙升的 Steps 和累加的 Token 总量透顶对冲,账单上风反而会退化至广泛。

这种不追求万亿参数、强调极致性价比的道路,相同硬性框定了 Hy3 的时刻鸿沟。

横向对比国内第一梯队,当阿里通义 Qwen3-Max、月之暗面 Kimi K2.5 等同业高抬高打,选拔用万亿参数的超等鸿沟去强攻高智能制高点,并动辄将百万级长文本变为行业标配时,Hy3 依然信守在 256K 的凹凸文窗口。

这里的时刻劣势不言而谕。面临超长源码库、批量大跨度历史卷宗等超长文本场景,256K 的容量上限让它径直失去了入场券。但其生意上风在于,不盲目跟风去卷大参数与长文本,恰正是其压低预西席与推理老本,追求单字智能密度的体现。

特情理的是,「赛博史官」在著作的终末认真文书加入混元团队,全职从事大模子评估和不雅测妙技探索。

但对于这篇论述的主角而言,故事才刚刚驱动。Hy3 郑再版是姚顺雨自前年 12 月空降腾讯、接掌混元大模子部后交出的首份中枢获利单。这位前 OpenAI 盘问员顶着“透顶重建团队”的巨大压力,在短短半年内通过极求实的后西席与短板对皆,将混元从早期的结构性瑕玷中拉了出来,

但组织架构层面的挑战,远比时刻层面的挑战更为辣手。腾讯里面的”联邦制”面貌由来已久。WXG(微信行状群)在腾讯里面领有超然地位,历久秉持孤苦于集团意识除外的产物理念。

据《中国企业家》报谈,微信高层在2026年年会上曾公开抒发但愿我方西席大模子、集团赐与更多GPU撑持的诉求。微信团队的模子才智在低调中快速爬坡,一个领有十亿级用户进口、掌捏着中国最密集酬酢场景的部门,与一支需要阐述自身价值的孤苦时刻团队,两者的旅途注定交叉。

在腾讯宽敞复杂的组织生态里开云体育(中国)官方网站,这不是浮浅的「谁作念得更好」的时刻评选,而是对于资源分派、话语权包摄、乃至改日AI计策坐方针暗战。



相关资讯
热点资讯
  • 友情链接:

Powered by 开云kaiyun登录入口登录APP下载(中国)官方网站 @2013-2022 RSS地图 HTML地图