Dockerless: Environment-Free Program Verifier for Coding Agents Paper • 2606.28436 • Published Jun 26 • 113
Program-as-Weights: A Programming Paradigm for Fuzzy Functions Paper • 2607.02512 • Published 26 days ago • 236
EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments Paper • 2607.02440 • Published 26 days ago • 51
Evolution Fine-Tuning: Learning to Discover Across 371 Optimization Tasks Paper • 2606.29082 • Published about 1 month ago • 42
SkillHone: A Harness for Continual Agent Skill Evolution Through Persistent Decision History Paper • 2606.08671 • Published Jun 23 • 46
AgenticDataBench: A Comprehensive Benchmark for Data Agents Paper • 2607.01647 • Published 26 days ago • 37
MemSyco-Bench: Benchmarking Sycophancy in Agent Memory Paper • 2607.01071 • Published 27 days ago • 30
Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs Paper • 2606.32032 • Published 28 days ago • 29
EverMemOS: A Self-Organizing Memory Operating System for Structured Long-Horizon Reasoning Paper • 2601.02163 • Published Jan 5 • 15
Tucker Attention: A generalization of approximate attention mechanisms Paper • 2603.30033 • Published Mar 31