MDN: Parallelizing Stepwise Momentum for Delta Linear Attention Paper • 2605.05838 • Published May 7 • 6
Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning Paper • 2609.03430 • Published 4 days ago • 162
Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM Paper • 2609.04098 • Published 4 days ago • 73
Rethinking On-Policy Distillation of Large Language Models II: One Training Example Paper • 2609.04172 • Published 4 days ago • 77
Post-Training Language Models for Gold-Medal Performance in Coding Competitions Paper • 2609.02849 • Published 5 days ago • 9
Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Model Paper • 2607.22083 • Published Jul 27 • 10
On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability Paper • 2608.30320 • Published 7 days ago • 53
Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement Paper • 2608.31046 • Published 7 days ago • 142
Self-Improving Pretraining: using post-trained models to pretrain better models Paper • 2601.21343 • Published Jan 29 • 21
A Programming Paradigm for Spatiotemporal Composability Paper • 2608.25512 • Published 12 days ago • 16
D^3-MOPD: Adaptive Dynamic Domain ScheDuling for Efficient Multi-Teacher Distillation Paper • 2608.24987 • Published 13 days ago • 26