Performance results of AI coding models on Prefect tasks, measuring success rate and execution time with high precision.
| Model | Passed | Avg Duration | Success Rate |
|---|---|---|---|
| #1 gemini-3.5-flashNEW | 11 | 776.0s | 79% |
| #2 claude-5-sonnet | 11 | 738.5s | 79% |
| #3 glm-4.7 | 9 | 392.6s | 60% |
| #4 gemini-3.1-pro | 8 | 266.8s | 53% |
| #5 claude-4-6-sonnet | 7 | 262.3s | 47% |
| #6 deepseek-4-pro | 6 | 938.8s | 43% |
| #7 gemini-3-flash | 6 | 244.5s | 40% |
| #8 glm-5.2 | 3 | 839.5s | 21% |