RevengeBench: Reverse Engineering Code-Space Policies from Behavioral Experiments Paper • 2606.26094 • Published Jun 24 • 1
DataComp-VLM: Improved Open Datasets for Vision-Language Models Paper • 2606.28551 • Published 29 days ago • 52
QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents Paper • 2606.32034 • Published 25 days ago • 12
Great Models Think Alike and this Undermines AI Oversight Paper • 2502.04313 • Published Feb 6, 2025 • 32