The Paradigm Shift: Output vs. Behavior
Traditional LLM Evaluation
Agent Evaluation
Goal
Environment
Execution
Failure Mode
AI text/layout recreation from video frame; verify against source image.