OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models Paper • 2607.28609 • Published 20 days ago • 72
SRPO Collection Official Collections for SRPO: Self-Referential Policy Optimization for Vision-Language-Action Models, including SFT and RL models. • 6 items • Updated 13 days ago • 2
SRPO Collection Official Collections for SRPO: Self-Referential Policy Optimization for Vision-Language-Action Models, including SFT and RL models. • 6 items • Updated 13 days ago • 2
WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning Paper • 2607.29613 • Published 19 days ago • 28
WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning Paper • 2607.29613 • Published 19 days ago • 28 • 7
WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning Paper • 2607.29613 • Published 19 days ago • 28 • 7
WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning Paper • 2607.29613 • Published 19 days ago • 28 • 7
WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning Paper • 2607.29613 • Published 19 days ago • 28 • 7
WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning Paper • 2607.29613 • Published 19 days ago • 28 • 7
WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning Paper • 2607.29613 • Published 19 days ago • 28
WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning Paper • 2607.29613 • Published 19 days ago • 28