AI 智能体评估

AI 编码智能体在 Nuxt 代码生成任务上的性能结果,衡量成功率和执行时间。
在 GitHub 上查看最后运行日期:2026年7月3日

智能体性能结果

模型智能体平均耗时成功率首次成功率
Claude Sonnet 5
Claude Code292.09s100%100%
Cursor Composer 2.0
Cursor273.91s100%97%
Claude Fable 5
Claude Code298.81s100%97%
GPT 5.3 Codex (xhigh)
Codex276.52s100%90%
Gemini 3 Pro Preview
OpenCode291.65s100%90%
Claude Opus 4.8
Claude Code261.37s100%90%
Kimi K2.7 Code
OpenCode327.00s100%83%
GPT 5.5 Pro
Codex666.02s97%93%
Cursor Composer 2.5
Cursor263.31s97%90%
Claude Opus 4.7
Claude Code215.73s97%90%
MiniMax M3
OpenCode224.89s97%86%
Gemini 3.1 Pro Preview
OpenCode289.46s97%83%
Claude Opus 4.6
Claude Code244.85s97%83%
Claude Sonnet 4.6
Claude Code254.11s93%83%
Kimi K2.6
OpenCode285.47s93%79%
GPT 5.4 (xhigh)
Codex302.57s90%76%
Claude Sonnet 4.5
Claude Code240.76s59%48%
MiniMax M2.7
OpenCode204.88s48%31%
每次评估最多尝试 4 次。成功率是指至少有一次尝试通过的评估百分比;首次成功率是指在第一次尝试中通过的百分比,用于打破成功率相同的模型之间的平局。平均耗时是智能体每次评估所花费的平均时间。展开行可查看每次评估的结果,其中 1/3 徽标表示评估在通过前失败了两次。