of Mathematical Reasoning in Open Language Models, arXiv, 2024. 2. Rafailov et al., Direct Preference Optimization: Your Language Model is Secretly a Reward Model, In NeurIPS, 2023. 3. Liu et al., Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs, arXiv, 2024. 4. Zheng et al., Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena, In NeurIPS Datasets & Benchmark Track, 2023. 5. Zhao et al., WildChat: 1M ChatGPT Interaction Logs in the Wild, In ICLR, 2024. 6. Cui et al., ULTRAFEEDBACK: Boosting Language Models with Scaled AI Feedback, In ICML, 2024. 7. Shao et al., DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research, In ICML, 2026.