Author Evals ML Editorial Posts (1) Evaluation Designing an LLM Evaluation That Actually Tells You Something Task-grounded eval sets, grader choice, sampling variance and the contamination traps that make benchmark scores misleading. July 31, 2026