baohao/OPD_Search_Qwen3-8B_SFT-RL_to_Search_Qwen3-4B-Instruct-2507_SFT 4B • Updated 4 days ago • 19 • 1
LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget Paper • 2607.14952 • Published 12 days ago • 203
Where to cut, how deep: BPE and Unigram-LM on chemistry SMILES Paper • 2607.05691 • Published 22 days ago • 4
TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning Paper • 2606.32017 • Published 28 days ago • 12
ENPIRE: Agentic Robot Policy Self-Improvement in the Real World Paper • 2606.19980 • Published Jun 18 • 15
SkillEvolBench: Benchmarking the Evolution from Episodic Experience to Procedural Skills Paper • 2605.24117 • Published May 22 • 22
DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards Paper • 2605.21467 • Published May 20 • 207