conv.

All stories
AIQuiet 12d · day 12

NVIDIA's AVO agent scores 100% on ARC-AGI-3 puzzle test without instructions

The coding agent, built around Anthropic's Claude Opus 5, solved all 183 levels of the benchmark test using a harness architecture originally designed for GPU kernel optimization.

What to know

  • NVIDIA's AVO agent achieved 100% accuracy on ARC-AGI-3's public benchmark (all 183 levels) without receiving prior instructions, demonstrating transfer learning from GPU kernel optimization to visual logic puzzles.
  • The harness architecture significantly outperformed both the base Claude Opus 5 model (30% accuracy) and competing agent frameworks like VISTA (12% fewer actions required).
  • The AVO's success was limited to public test data; the ARC-AGI-3 evaluation platform does not allow custom agent harnesses to run against the private test set, leaving real-world generalization performance unknown.

NVIDIA Developer of AVO agentAnthropic Creator of Claude Opus 5 model

NVIDIA's AVO agent scores 100% on ARC-AGI-3 puzzle test without instructions
wccftech.com

How it unfolded 2 developments, newest first · click a bar or a number to jump articles

Peak 2 pieces in 3h at Aug 21, 3 PM; 2 pieces over 12 days (2 articles) Aug 21, 3 PM — 2 pieces · 2 articles — Google News 1, Newswires 1Aug 21, 6 PM — quietAug 21, 9 PM — quietAug 22, 12 AM — quietAug 22, 3 AM — quietAug 22, 6 AM — quietAug 22, 9 AM — quietAug 22, 12 PM — quietAug 22, 3 PM — quietAug 22, 6 PM — quietAug 22, 9 PM — quietAug 23, 12 AM — quietAug 23, 3 AM — quietAug 23, 6 AM — quietAug 23, 9 AM — quietAug 23, 12 PM — quietAug 23, 3 PM — quietAug 23, 6 PM — quietAug 23, 9 PM — quietAug 24, 12 AM — quietAug 24, 3 AM — quietAug 24, 6 AM — quietAug 24, 9 AM — quietAug 24, 12 PM — quietAug 24, 3 PM — quietAug 24, 6 PM — quietAug 24, 9 PM — quietAug 25, 12 AM — quietAug 25, 3 AM — quietAug 25, 6 AM — quietAug 25, 9 AM — quietAug 25, 12 PM — quietAug 25, 3 PM — quietAug 25, 6 PM — quietAug 25, 9 PM — quietAug 26, 12 AM — quietAug 26, 3 AM — quietAug 26, 6 AM — quietAug 26, 9 AM — quietAug 26, 12 PM — quietAug 26, 3 PM — quietAug 26, 6 PM — quietAug 26, 9 PM — quietAug 27, 12 AM — quietAug 27, 3 AM — quietAug 27, 6 AM — quietAug 27, 9 AM — quietAug 27, 12 PM — quietAug 27, 3 PM — quietAug 27, 6 PM — quietAug 27, 9 PM — quietAug 28, 12 AM — quietAug 28, 3 AM — quietAug 28, 6 AM — quietAug 28, 9 AM — quietAug 28, 12 PM — quietAug 28, 3 PM — quietAug 28, 6 PM — quietAug 28, 9 PM — quietAug 29, 12 AM — quietAug 29, 3 AM — quietAug 29, 6 AM — quietAug 29, 9 AM — quietAug 29, 12 PM — quietAug 29, 3 PM — quietAug 29, 6 PM — quietAug 29, 9 PM — quietAug 30, 12 AM — quietAug 30, 3 AM — quietAug 30, 6 AM — quietAug 30, 9 AM — quietAug 30, 12 PM — quietAug 30, 3 PM — quietAug 30, 6 PM — quietAug 30, 9 PM — quietAug 31, 12 AM — quietAug 31, 3 AM — quietAug 31, 6 AM — quietAug 31, 9 AM — quietAug 31, 12 PM — quietAug 31, 3 PM — quietAug 31, 6 PM — quietAug 31, 9 PM — quietYesterday, 12 AM — quietYesterday, 3 AM — quietYesterday, 6 AM — quietYesterday, 9 AM — quietYesterday, 12 PM — quietYesterday, 3 PM — quietYesterday, 6 PM — quietYesterday, 9 PM — quietToday, 12 AM — quietToday, 3 AM — quietToday, 6 AM — quietToday, 9 AM — quietToday, 12 PM — quiet 1–2
Aug 22Aug 23Aug 24Aug 25Aug 26Aug 27Aug 28Aug 29Aug 30Aug 31now · 3:38 PM ET
  1. 1

    AVO demonstrates efficiency advantages over competing agent frameworks

    The AVO agent solved the 183 levels using 6,624 actions, representing a 12% efficiency gain compared to VISTA, which required 7,542 actions. The base Claude Opus 5 model achieved only 30% accuracy on the same benchmark, highlighting the value of NVIDIA's harness architecture.

    “NVIDIA's coding agent AVO scored 100% on ARC-AGI-3's 25 public games, solving all 183 levels. The agent receives no rules or stated goals.”
    — Holy, Social media commenter · source
  2. 2

    NVIDIA's AVO agent scores 100% on ARC-AGI-3 benchmark

    NVIDIA announced that its AVO coding agent achieved a perfect score on ARC-AGI-3's public test set, solving all 183 levels across 25 games without prior instruction. The agent, a harness wrapper around Anthropic's Claude Opus 5, demonstrated the ability to transfer its self-correcting logic from GPU kernel optimization to visual logic puzzles.

    1. first by Wccftech, 11d ago