Don’t Pass@k: A Bayesian Framework for Large Language Model EvaluationPublished in International Conference on Learning Representations (ICLR) 2026, 2026Share on Bluesky Facebook LinkedIn X (formerly Twitter) Previous Next