测试日期: 2026-06-06 ~ 2026-06-07
测试主题: AI Agent 对企业组织架构的影响
测试技能: mckinsey-presentation-generator(规范驱动型)
评分维度: 结构(25) + 设计(25) + 内容(25) + 代码(25) = 100分
扣分规则: 仅扣用户明确报告的问题Agent: Openclaw
目录
一、原始分四维度明细
二、综合排名(含扣分)
三、修复后内容直观感受排名
四、扣分详情
五、关键发现与结论
一、原始分四维度明细(满分100)
评分维度:结构合规(25) + 设计规范(25) + 内容质量(25) + 代码质量(25)
| 模型 | 结构(25) | 设计(25) | 内容(25) | 代码(25) | 原始分 |
| GPT-5.5 | 25 | 25 | 25 | 25 | 100 |
| MiniMax-M3 | 25 | 22 | 25 | 25 | 97 |
| kimi-k2.6 | 25 | 19 | 25 | 23 | 92 |
| mimo-v2.5-pro | 25 | 19 | 25 | 23 | 92 |
| qwen3.6-plus | 25 | 19 | 25 | 23 | 92 |
| mimo-v2.5 | 25 | 19 | 25 | 21 | 90 |
| hy3-preview | 20 | 19 | 25 | 10 | 74 |
| qwen3.7-plus | 20 | 19 | 25 | 10 | 74 |
| doubao-seed-2-0-pro | 20 | 19 | 25 | 10 | 74 |
| qwen3.7-max | 20 | 19 | 21 | 10 | 70 |
维度说明
• 结构合规(25):DOCTYPE、viewport、960×540、响应式缩放、header bar颜色
• 设计规范(25):border-radius=0、强调色≤2、无生成图片、字体规范
• 内容质量(25):来源引用数量、内容多样性(表格/SVG/列表/段落)、图表数量
• 代码质量(25):class滥用程度、SVG圆角、响应式支持、内联CSS
二、综合排名(含扣分)
| # | 模型 | 原始分 | 导航扣分 | 布局扣分 | 最终分 | 等级 |
| 1 | GPT-5.5 | 100 | -5 | 0 | 95 | A+ |
| 2 | kimi-k2.6 | 92 | -5 | -5 | 82 | B+ |
| 2 | MiniMax-M3 | 97 | -5 | -10 | 82 | B+ |
| 2 | mimo-v2.5-pro | 92 | -5 | -5 | 82 | B+ |
| 5 | qwen3.6-plus | 92 | -5 | -10 | 77 | C+ |
| 5 | mimo-v2.5 | 90 | -3 | -10 | 77 | C+ |
| 7 | qwen3.7-plus | 74 | 0 | -5 | 69 | C+ |
| 7 | hy3-preview | 74 | 0 | -5 | 69 | C+ |
| 9 | doubao-seed-2-0-pro | 74 | 0 | -10 | 64 | C |
| 10 | qwen3.7-max | 70 | 0 | -10 | 60 | C |
| – | deepseek-v4-pro | – | – | – | F | F |
| – | deepseek-v4-flash | – | – | – | F | F |
三、修复后内容直观感受排名
由老板根据修复后的最终交付物视觉效果给出。
| # | 模型 | 直观感受 | 技术评分 |
| 1 | GPT-5.5 | 第1 | 95 (第1) |
| 2 | qwen3.7-plus | 第2 | 69 (第7) |
| 3 | hy3-preview | 第3 | 69 (第7) |
| 4 | kimi-k2.6 | 第4 | 82 (第2) |
| 5 | mimo-v2.5-pro | 第5 | 82 (第2) |
| 6 | qwen3.7-max | 第6 | 60 (第10) |
| 7 | MiniMax-M3 | 第7 | 82 (第2) |
| 8 | mimo-v2.5 | 第8 | 77 (第5) |
| 9 | doubao-seed-2-0-pro | 第9 | 64 (第9) |
关键发现:qwen3.7-plus 技术分仅69(第7),但直观感受排第2。阴影+卡片创造了视觉层次感。视觉丰富度 ≠ 技术合规。
但是直观感受好没法掩盖生成的代码质量问题:
具体情况:
第一梯队:GPT-5.5, MiniMax-M3, mimo-v2.5-pro, kimi-k2.6, qwen3.6-plus, mimo-v2.5
- 全部通过结构合规检查
- 全部支持响应式缩放
- 内容质量优秀(8-10个来源引用)
- 代码质量高(class ≤23)
- 主要差异:强调色控制(GPT-5.5仅3种 vs 其他6-13种)
第二梯队:qwen3.7-plus, doubao-seed, hy3-preview, qwen3.7-max
- 缺少响应式缩放脚本
- class属性严重滥用(138-399个)
- 强调色失控(6-22种)
- 代码质量显著低于第一梯队
四、扣分详情
4.1 键盘导航扣分
| 模型 | 用户反馈 | 扣分 |
| GPT-5.5 | 对键盘没反应 | -5 |
| kimi-k2.6 | 用户确认导航有问题 | -5 |
| MiniMax-M3 | 用户确认导航有问题 | -5 |
| mimo-v2.5-pro | 向下键黑屏 | -5 |
| mimo-v2.5 | 导航不完整 | -3 |
| qwen3.6-plus | 用户确认导航有问题 | -5 |
| 其他4个 | 不扣分 | 0 |
4.2 布局扣分
| 模型 | 用户反馈 | 扣分 |
| GPT-5.5 | 无 | 0 |
| kimi-k2.6 | 多页布局不整齐 | -5 |
| MiniMax-M3 | 全部挤在上半页 | -10 |
| mimo-v2.5-pro | 部分上下不平衡 | -5 |
| mimo-v2.5 | 全黑背景+不整齐 | -10 |
| qwen3.6-plus | 多页右侧不整齐 | -10 |
| qwen3.7-plus | 2页上下不平衡 | -5 |
| hy3-preview | 卡片越界 | -5 |
| doubao-seed | 多页文字重叠 | -10 |
| qwen3.7-max | 多页上下不平衡 | -10 |
五、关键发现与结论
5.1 GPT-5.5 是唯一无可挑剔的模型
技术评分满分100,直观感受也排第1。内容质量、布局结构、设计规范全部达标,唯一扣分是键盘导航未绑定(-5分),最终95分遥遥领先。
5.2 视觉丰富度 ≠ 技术合规
qwen3.7-plus 技术分仅69(第7),但直观感受排第2。原因:阴影+卡片创造了视觉层次感,打破了 McKinsey 技能的「扁平」限制。说明技能规范可能过于严格,实际用户更喜欢有层次感的设计。
5.3 布局是最影响观感的因素
MiniMax-M3 原始分97(第2),但布局全部挤在上半页扣10分后降到82。doubao-seed 文字重叠直接从74降到64。布局缺陷比导航缺失更影响用户观感。
5.4 DeepSeek 全系阵亡
deepseek-v4-pro 和 deepseek-v4-flash 均无法完成规范驱动型任务,运行48分钟后超时。规范驱动型技能对 DeepSeek 模型能力不足。
六、成本效率分析与最终推荐
6.1 API 价格对比
| 模型 | 输入价格 | 输出价格 | 技术分 | class属性数 | 效率评级 |
| GPT-5.5 | 5美元/百万token | 30美元/百万token | 95 | 10 | 高 |
| mimo-v2.5-pro | 3元/百万token | 6元/百万token | 82 | 20 | 高 |
| kimi-k2.6 | 6.5元/百万token | 27元/百万token | 82 | 20 | 中 |
| qwen3.7-plus | 2元/百万token | 8元/百万token | 69 | 240 | 低 |
| hy3-preview | 2元/百万token | 8元/百万token | 69 | 399 | 低 |
6.2 class 滥用对实际成本的影响
qwen3.7-plus(240个class)和 hy3-preview(399个class)的 class 滥用意味着:
• 同样的页面内容,生成更多冗余 HTML 标签 → 实际输出 token 消耗远超标价
• mimo-v2.5-pro 仅 20 个 class,代码精简高效,实际 token 消耗接近标价
• class 滥用的模型,实际输出成本可能比标价高 30%~50%
6.3 最终推荐
推荐一:预算充足 → GPT-5.5
• 技术评分 95(满分100),直观感受排第1,技术和视觉双冠王
• 唯一零布局缺陷的模型,内容质量无可挑剔
• 缺点:API 价格较贵,性价比不高,整体成本大约是mimo-v2.5-pro 15 倍以上
• 适用场景:对质量要求极高、预算不受限的场景
推荐二:性价比最优 → mimo-v2.5-pro
• 技术分 82,与 kimi-k2.6 同分,但价格仅为其 1/4
• 输出单价最低(6元/百万token),无 class 滥用,代码精简高效
• 同样的内容,token 消耗比 qwen3.7-plus 和 hy3-preview 低 30%~50%
• 适用场景:日常生产环境、高频调用、成本敏感型项目
不推荐
• kimi-k2.6:输出 27元/百万token,是 mimo-v2.5-pro 的 4.5 倍,性价比极差
• qwen3.7-plus / hy3-preview:输入便宜但 class 滥用严重,实际输出成本膨胀
• doubao-seed-2-0-pro:多页文字重叠,布局缺陷最严重
• DeepSeek 全系:无法完成规范驱动型任务
结论:mimo-v2.5-pro 是性价比最优解——技术分82、输出单价最低、无class滥用、代码效率最高。日常使用优先考虑。
附:测试产出物:
GPT-5.5:
Mimo-v2.5-pro:
qwen3.7-plus:
hy3-preview:
Kimi-K2.6:
Minimax-M3:
Qwen3.7-max:
Mimo-v2.5:
doubao-seed-2.0-pro: