在开发机 10.2.145.100 上,用同一套反馈题、同一套「交付物实核」标准,横向对比
11 档模型(中台 / 移动 / 电信 × 是否开思考)。每档跑 Medium 7 题 + Heavy 7 题,共 14 题;
并发 C=1/2/4,超时 900s 并带 recover。成功率按是否交出合格交付物计,不只看会话是否结束。
去查金价 / GDP / 铜价等公开数据,整理成一张像样的 Excel 交出来。
考的是:找数、整理、表格写实、文件交对。工具链短,成败主要看表里有没有真数据(有效 xlsx,非空 ≥2 行)。
按数字员工套路走一遍:自己写 Python 脚本,用 bash 跑起来,一次交出至少 3 个文件(表 + 摘要 + 看板),再 present_files。
考的是:会不会按流程干活、写脚本、一次交齐多产物。更像完整交付流水线,不只是一张表。
综合成功率 = Medium+Heavy 共 14 题过关比例;分档图分别看两档本事。
C=4 P95 是高压下的脚本级时延(秒);贴 900s 附近多半是超时/压垮,不是「刚好跑满」。
质量第一梯队:移动 GLM 开思考(11/14)。第二梯队并列:移动 GLM 关思考与电信 DS 开思考(均为 10/14)——前者 Medium 更快,后者 Medium/Heavy 都稳在 5/7。电信 GLM/Kimi 开思考处第三梯队(8/14)。中台 Kimi 关思考综合 50%,靠 Heavy 撑场面;开思考反而拖累 Heavy。移动/电信 Kimi 关思考与中台 Kimi 开思考都在 43% 一带;移动 K2.7-code 垫底。
| 名次 | 模型 | 网关 | 思考 | Medium | Heavy | 合计 | 成功率 | Med C4 P95 | Hvy C4 P95 |
|---|
最高 11/14(GLM 开)。关思考 10/14 且更快。
Kimi / K2.7-code 综合偏弱,Heavy 高压易崩。
最高 10/14(DS 开),追平移动 GLM 关。
Kimi 开思考抬升 Heavy;GLM 开思考中等偏上。
Kimi 关思考 7/14:Heavy 强、Medium 弱。
开思考综合掉到 6/14,Heavy 明显变差。
| 网关 | 实验档位数 | 该网关最高综合 | 对应模型 |
|---|---|---|---|
| 移动 | 4 档 | 11/14 最高 | GLM 开思考 |
| 电信 | 5 档 | 10/14 最高 | DS 开思考 |
| 中台 | 2 档 | 7/14 最高 | Kimi 关思考 |
GLM:移动开思考(11/14)明显强于电信开思考(8/14);移动关思考也强于电信关思考。Kimi:电信开思考(8/14)好于电信关/中台开(6/14);中台关思考(7/14)靠 Heavy,不宜指望 Medium。DS:仅电信有开思考档,综合已进第二梯队。
交付质量优先 →移动 GLM 开思考。质量与速度平衡 →移动 GLM 关思考,或电信 DS 开思考。电信主路由备选 → DS 开 / GLM 开 / Kimi 开(Kimi 偏 Heavy)。中台继续用 Kimi 关思考扛脚本链,不要强行开思考。避免把移动 Kimi / K2.7-code 当作高并发主模型。