--- title: "How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks" type: paper-summary source_paper: "2026-08-14_21-39-38Z_HowDoAgentsFailonAutoResearch_End_to_EndDiagnostic.md" --- # Summary: How Do Agents Fail on AutoResearch **Original paper:** [arXiv: 2608.14905](http://arxiv.org/abs/2608.14905v1) ## Summary AutoResearchEval evaluates 100 frontier research tasks, 800 agent trajectories, and eight harness-model combinations across seven domains. Its 45-pattern failure taxonomy finds a common metacognitive deficit: agents often cannot verify outputs against evidence or revise after detecting errors. ## Why it matters Autonomous research needs process-level evaluation and artifact-grounded verification, not just a final-answer score. The paper identifies the missing control loop directly.