全量模型横向对比

Medium + Heavy · 交付物实核 · 11 档 · C=1/2/4 · n=7/档 · 开发机 10.2.145.100 · 2026-07-22/23
中台 ×2 CME ×4 电信 ×5
11/14
第1 · CME GLM 开 · 79%
10/14
第2 · CME GLM 关 · 71%
10/14
第2 · 电信 DS 开 · 71%
5/14
末位 · CME K2.7 开 · 36%
拉通结论

质量第一梯队:CME GLM 开思考(11/14)。第二梯队并列:CME GLM 关思考与电信 DS 开思考(均为 10/14)——前者 Medium 更快,后者 Medium/Heavy 都稳在 5/7。电信 GLM/Kimi 开思考处第三梯队(8/14)。中台 Kimi 关思考综合 50%,靠 Heavy 撑场面;开思考反而拖累 Heavy。CME/电信 Kimi 关思考与中台 Kimi 开思考都在 43% 一带;CME K2.7-code 垫底。

综合成功率(Medium+Heavy,n=14)

Source: k26 full report 07-22 + telecom/kimi-thinking audits 07-23 · deliverable-audited

Medium vs Heavy 分档成功率

Medium (%)Heavy (%)
Medium=查数填 Excel;Heavy=写脚本→跑→多文件交付

C=4 P95 时延(秒,越低越快)

Medium C=4 P95 (s)Heavy C=4 P95 (s)
Script-level P95 · 900s 附近多为超时/压垮

全量排行榜(按综合成功率)

名次模型网关思考 MediumHeavy合计成功率 Med C4 P95Hvy C4 P95

按网关看

CME(移动)

最高 11/14(GLM 开)。关思考 10/14 且更快。

Kimi / K2.7-code 综合偏弱,Heavy 高压易崩。

电信

最高 10/14(DS 开),追平 CME GLM 关。

Kimi 开思考抬升 Heavy;GLM 开思考中等偏上。

中台

Kimi 关思考 7/14:Heavy 强、Medium 弱。

开思考综合掉到 6/14,Heavy 明显变差。

网关实验档位数该网关最高综合对应模型
CME4 档11/14 最高GLM 开思考
电信5 档10/14 最高DS 开思考
中台2 档7/14 最高Kimi 关思考
同模型换网关 / 开思考的差异

GLM:CME 开思考(11/14)明显强于电信开思考(8/14);CME 关思考也强于电信关思考。Kimi:电信开思考(8/14)好于电信关/中台开(6/14);中台关思考(7/14)靠 Heavy,不宜指望 Medium。DS:仅电信有开思考档,综合已进第二梯队。

选型建议

交付质量优先 → CME GLM 开思考。质量与速度平衡 → CME GLM 关思考,或电信 DS 开思考。电信主路由备选 → DS 开 / GLM 开 / Kimi 开(Kimi 偏 Heavy)。中台继续用 Kimi 关思考扛脚本链,不要强行开思考。避免把 CME Kimi / K2.7-code 当作高并发主模型。