A sketch-guided multi-objective alignment framework for improving the correctness, efficiency, and algorithmic reasoning of code language models.
reinforcement-learning program-synthesis pytorch code-generation preference-learning dpo large-language-models starcoder llm-as-a-judge starcoder2 algorithmic-reasoning direct-preference-optimization llm-alignment code-language-models
-
Updated
Jul 29, 2026 - Python