全量模型横向对比

Medium + Heavy · 交付物实核 · 11 档 · C=1/2/4 · n=7/档 · 开发机 10.2.145.100 · 2026-07-22/23
中台 ×2 移动 ×4 电信 ×5

背景:这批实验在测什么

在开发机 10.2.145.100 上,用同一套反馈题、同一套「交付物实核」标准,横向对比 11 档模型(中台 / 移动 / 电信 × 是否开思考)。每档跑 Medium 7 题 + Heavy 7 题,共 14 题; 并发 C=1/2/4,超时 900s 并带 recover。成功率按是否交出合格交付物计,不只看会话是否结束。

Medium(中型)· 查数填表

去查金价 / GDP / 铜价等公开数据,整理成一张像样的 Excel 交出来。

考的是:找数、整理、表格写实、文件交对。工具链短,成败主要看表里有没有真数据(有效 xlsx,非空 ≥2 行)。

Heavy(重型)· 脚本流水线

按数字员工套路走一遍:自己写 Python 脚本,用 bash 跑起来,一次交出至少 3 个文件(表 + 摘要 + 看板),再 present_files。

考的是:会不会按流程干活、写脚本、一次交齐多产物。更像完整交付流水线,不只是一张表。

怎么读后面的图

综合成功率 = Medium+Heavy 共 14 题过关比例;分档图分别看两档本事。

C=4 P95 是高压下的脚本级时延(秒);贴 900s 附近多半是超时/压垮,不是「刚好跑满」。

11/14
第1 · 移动 GLM 开 · 79%
10/14
第2 · 移动 GLM 关 · 71%
10/14
第2 · 电信 DS 开 · 71%
5/14
末位 · 移动 K2.7 开 · 36%
拉通结论

质量第一梯队:移动 GLM 开思考(11/14)。第二梯队并列:移动 GLM 关思考与电信 DS 开思考(均为 10/14)——前者 Medium 更快,后者 Medium/Heavy 都稳在 5/7。电信 GLM/Kimi 开思考处第三梯队(8/14)。中台 Kimi 关思考综合 50%,靠 Heavy 撑场面;开思考反而拖累 Heavy。移动/电信 Kimi 关思考与中台 Kimi 开思考都在 43% 一带;移动 K2.7-code 垫底。

综合成功率(Medium+Heavy,n=14)

Source: k26 full report 07-22 + telecom/kimi-thinking audits 07-23 · deliverable-audited

Medium vs Heavy 分档成功率

Medium (%)Heavy (%)
Medium=查数填 Excel;Heavy=写脚本→跑→多文件交付

C=4 P95 时延(秒,越低越快)

Medium C=4 P95 (s)Heavy C=4 P95 (s)
Script-level P95 · 900s 附近多为超时/压垮

全量排行榜(按综合成功率)

名次模型网关思考 MediumHeavy合计成功率 Med C4 P95Hvy C4 P95

按网关看

移动

最高 11/14(GLM 开)。关思考 10/14 且更快。

Kimi / K2.7-code 综合偏弱,Heavy 高压易崩。

电信

最高 10/14(DS 开),追平移动 GLM 关。

Kimi 开思考抬升 Heavy;GLM 开思考中等偏上。

中台

Kimi 关思考 7/14:Heavy 强、Medium 弱。

开思考综合掉到 6/14,Heavy 明显变差。

网关实验档位数该网关最高综合对应模型
移动4 档11/14 最高GLM 开思考
电信5 档10/14 最高DS 开思考
中台2 档7/14 最高Kimi 关思考
同模型换网关 / 开思考的差异

GLM:移动开思考(11/14)明显强于电信开思考(8/14);移动关思考也强于电信关思考。Kimi:电信开思考(8/14)好于电信关/中台开(6/14);中台关思考(7/14)靠 Heavy,不宜指望 Medium。DS:仅电信有开思考档,综合已进第二梯队。

选型建议

交付质量优先 →移动 GLM 开思考。质量与速度平衡 →移动 GLM 关思考,或电信 DS 开思考。电信主路由备选 → DS 开 / GLM 开 / Kimi 开(Kimi 偏 Heavy)。中台继续用 Kimi 关思考扛脚本链,不要强行开思考。避免把移动 Kimi / K2.7-code 当作高并发主模型。