Methodology

StupidLLM uses a CVSS-inspired severity scoring system to rate every documented AI agent failure on a 0-10 scale. Each incident is verified against source evidence and categorized by failure mode and root cause.

Severity Scoring (0-10)

9.0–10.0Critical

Causes irreversible damage: data loss, security breach, production outage.

7.0–8.9High

Significant impact: corrupted codebase, API key exposure, system instability.

4.0–6.9Medium

Moderate impact: logic errors, wasted resources, incorrect but recoverable output.

0.1–3.9Low

Minor issues: cosmetic bugs, harmless hallucinations, non-production impact.

Verification

Every incident includes a source URL (GitHub PR, tweet, blog post, news article) used to verify the claim. Verified incidents are confirmed against their source evidence. Unverified incidents are marked as such and may be updated when sources become available.