AdamHD: Decoupled Huber Decay Regularization for Language Model Pre-Training Paper • 2511.14721 • Published Nov 18, 2025 • 1
Stochastic Rounding for LLM Training: Theory and Practice Paper • 2502.20566 • Published Feb 27, 2025 • 1
Next-Latent Prediction Transformers Learn Compact World Models Paper • 2511.05963 • Published Nov 8, 2025 • 6
MiLe Loss: a New Entropy-Weighed Loss for Mitigating the Bias of Learning Difficulties in Large Language Models Paper • 2310.19531 • Published Jan 15 • 1
SimpleGPT: Improving GPT via A Simple Normalization Strategy Paper • 2602.01212 • Published Feb 1 • 4
GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling Paper • 2506.22049 • Published Jun 27, 2025 • 3
Rethinking Attention Output Projection: Structured Hadamard Transforms for Efficient Transformers Paper • 2603.08343 • Published Mar 9 • 2
KHRONOS: a Kernel-Based Neural Architecture for Rapid, Resource-Efficient Scientific Computation Paper • 2505.13315 • Published May 26, 2025 • 1