Cliff: Learning Process Rewards from the First Mistake Paper • 2609.02817 • Published 15 days ago • 21
V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning Paper • 2608.25580 • Published 22 days ago • 16
Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence Paper • 2608.11341 • Published Aug 11 • 70
FRPO/qwen3-4b-a9_dapo-dapo-noKL-clip0.2_0.28-mb4-eta100-bs256x5-n4 Text Generation • 4B • Updated Aug 15 • 163
FRPO/qwen3-4b-a9_dapo-dapo-noKL-clip0.2_0.28-mb4-eta100-bs256x5-n4 Text Generation • 4B • Updated Aug 15 • 163
FRPO/qwen3-4b-a1_base-k1-cNone-clip0.2-mb4-eta100-bs256x5-n4 Text Generation • 4B • Updated Aug 15 • 156
FRPO/qwen3-4b-a1_base-k1-cNone-clip0.2-mb4-eta100-bs256x5-n4 Text Generation • 4B • Updated Aug 15 • 156
FRPO/qwen3-4b-a0_klloss-lossKL-coef0.001-mb4-eta100-bs256x5-n4 Text Generation • 4B • Updated Aug 15 • 159
FRPO/qwen3-4b-a0_klloss-lossKL-coef0.001-mb4-eta100-bs256x5-n4 Text Generation • 4B • Updated Aug 15 • 159
FRPO/qwen3-1.7b-a9_dapo-dapo-noKL-clip0.2_0.35-mb4-eta100-bs256x5-n2-r3 Text Generation • 2B • Updated Aug 15 • 155
FRPO/qwen3-1.7b-a9_dapo-dapo-noKL-clip0.2_0.35-mb4-eta100-bs256x5-n2-r3 Text Generation • 2B • Updated Aug 15 • 155
FRPO/qwen3-1.7b-a9_dapo-dapo-noKL-clip0.2_0.28-mb4-eta100-bs256x5-n2-r3 Text Generation • 2B • Updated Aug 15 • 131
FRPO/qwen3-1.7b-a9_dapo-dapo-noKL-clip0.2_0.28-mb4-eta100-bs256x5-n2-r3 Text Generation • 2B • Updated Aug 15 • 131
FRPO/qwen3-1.7b-a9_dapo-dapo-noKL-clip0.2_0.28-mb4-eta100-bs256x5-n2-r2 Text Generation • 2B • Updated Aug 15 • 155
FRPO/qwen3-1.7b-a9_dapo-dapo-noKL-clip0.2_0.28-mb4-eta100-bs256x5-n2-r2 Text Generation • 2B • Updated Aug 15 • 155
FRPO/qwen3-1.7b-a9_dapo-dapo-noKL-clip0.2-mb4-eta100-bs256x5-n2-r3 Text Generation • 2B • Updated Aug 15 • 230
FRPO/qwen3-1.7b-a9_dapo-dapo-noKL-clip0.2-mb4-eta100-bs256x5-n2-r3 Text Generation • 2B • Updated Aug 15 • 230