AI research benchmark evaluation has a structural flaw: any task precise enough to grade is also precise enough to optimize ...