Krishnasri2027/qwen25-coder-1.5b-instruct-fine-tuned-merged Text Generation • 2B • Updated 19 days ago • 755 • 1
Krishnasri2027/qwen25-coder-1.5b-instruct-fine-tuned-merged Text Generation • 2B • Updated 19 days ago • 755 • 1
view article Article Illustrating Reinforcement Learning from Human Feedback (RLHF) +2 natolambert, LouisCastricato, lvwerra, Dahoas • Dec 9, 2022 • 427