Gitstar Ranking
Users
Organizations
Repositories
Rankings
Users
Organizations
Repositories
Sign in with GitHub
microsoft
Fetched on 2026/09/18 17:37
microsoft
/
Build26-BRK231-deploy-observe-learn-reinforcement-learning-for-production-agents
Sample code for improving multi-tool AI agents using SFT distillation and reinforcement fine-tuning — Qwen3-32B RFT achieving 86.9% quality on a retail customer service agent. From Microsoft Build 2026. -
View it on GitHub
https://build.microsoft.com
Star
13
Rank
1380320