Float accumulation order alone flips RL reward verdicts and sampler/trainer probabilities — reproduce it on real GPT-2, then remove it with an order-independent reduction. numpy-only, runs in seconds.
reinforcement-learning numpy floating-point reproducibility posit quire numerical-stability post-training determinism computer-arithmetic gpt-2 bfloat16 numerical-computing nondeterminism rlhf reward-model llm-training llm-evaluation grpo bit-exact
-
Updated
Aug 16, 2026 - Python