13 articles · page 1 of 1
The Little Book of Reinforcement Learning
2026-07-16
Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
2026-07-16
LeMario: Training a JEPA World Model on Super Mario Bros
2026-07-14
Is One Layer Enough? A Single Transformer Layer Matches Full-Parameter RL Train
2026-07-02
Ornith-1.0: self-improving open-source models for agentic coding
2026-06-29
Maxproof
2026-06-12
DeepSeek-V4 on Day 0: From Fast Inference to Verified RL with SGLang and Miles
2026-04-25
Hamilton-Jacobi-Bellman Equation: Reinforcement Learning and Diffusion Models
2026-03-30
Tree Search Distillation for Language Models Using PPO
2026-03-15
Chess engines do weird stuff
2026-02-17
MiniMax M2.5 released: 80.2% in SWE-bench Verified
2026-02-12
RLHF from Scratch
2026-02-10
Reinforcement Learning from Human Feedback
2026-02-07