StupidLLM
Incidents
Dashboard
Compare
Failure Modes
Methodology
Dashboard
Live AI agent reliability rankings based on 64 documented failures across 27 agents.
64
Total Incidents
6.7/10
Avg Severity
27
Agents Tracked
Most Incident Reports
1
Devin
12
4.9/10
2
Claude Code
8
6.4/10
3
Cursor
5
6.1/10
4
Multiple Agents
5
4.8/10
5
Github Copilot
4
10.0/10
6
Unknown Agent
4
8.5/10
7
Gemini Cli
3
10.0/10
8
Multiple Llms
3
3.8/10
9
Claude
2
1.8/10
10
Aider
1
6.3/10
Highest Severity (Worst)
1
Amazon Kiro
10.0
/10
2
Amazon Q
10.0
/10
3
Claude Cowork
10.0
/10
4
Cline
10.0
/10
5
Gemini Cli
10.0
/10
6
Github Copilot
10.0
/10
7
Gitlab Duo
10.0
/10
8
Gpt Sol
10.0
/10
9
Lovable
10.0
/10
10
Microsoft Copilot
10.0
/10