ReCrit: Transition-Aware Reinforcement Learning for Scientific Critic Reasoning
reinforcement-learning alignment rl reasoning self-correction llm vllm qwen sycophancy grpo scientific-reasoning critic-reasoning
-
Updated
May 27, 2026 - Python