{
 "generated": "AI4AI-Bench v1.5 mapped scores",
 "ladder": {
  "floor": 0,
  "baseline": 0.1,
  "optimum": 1.0
 },
 "points": [
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "high",
   "tokens": 86326,
   "score": 0.2335,
   "raw": 8.42,
   "evals": 8,
   "patchLines": 1014,
   "produced": true
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "low",
   "tokens": 82261,
   "score": 0.4239,
   "raw": 12.1,
   "evals": 18,
   "patchLines": 1011,
   "produced": true
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 120188,
   "score": 0.7137,
   "raw": 17.7,
   "evals": 19,
   "patchLines": 1017,
   "produced": true
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "medium",
   "tokens": 101535,
   "score": 0.2625,
   "raw": 8.98,
   "evals": 19,
   "patchLines": 898,
   "produced": true
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "xhigh",
   "tokens": 113845,
   "score": 0.543,
   "raw": 14.4,
   "evals": 16,
   "patchLines": 847,
   "produced": true
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "high",
   "tokens": 72116,
   "score": 0.0999,
   "raw": 5.82,
   "evals": 14,
   "patchLines": 60,
   "produced": true
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "low",
   "tokens": 85604,
   "score": 0.115,
   "raw": 6.13,
   "evals": 0,
   "patchLines": 61,
   "produced": true
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 107050,
   "score": 0.116,
   "raw": 6.15,
   "evals": 7,
   "patchLines": 235,
   "produced": true
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "medium",
   "tokens": 80359,
   "score": 0.101,
   "raw": 5.86,
   "evals": 13,
   "patchLines": 79,
   "produced": true
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "xhigh",
   "tokens": 71788,
   "score": 0.0927,
   "raw": 4.49,
   "evals": 16,
   "patchLines": 131,
   "produced": true
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "high",
   "tokens": 63170,
   "score": 0.0988,
   "raw": 5.62,
   "evals": 11,
   "patchLines": 5,
   "produced": true
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "low",
   "tokens": 7331,
   "score": 0.0984,
   "raw": 5.54,
   "evals": 6,
   "patchLines": 0,
   "produced": true
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "max",
   "tokens": 75854,
   "score": 0.1357,
   "raw": 6.53,
   "evals": 12,
   "patchLines": 64,
   "produced": true
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 35126,
   "score": 0.0985,
   "raw": 5.56,
   "evals": 21,
   "patchLines": 20,
   "produced": true
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "none",
   "tokens": 11320,
   "score": 0.0961,
   "raw": 5.11,
   "evals": 10,
   "patchLines": 10,
   "produced": true
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 62827,
   "score": 0.0995,
   "raw": 5.74,
   "evals": 15,
   "patchLines": 31,
   "produced": true
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "high",
   "tokens": 55312,
   "score": 0.0996,
   "raw": 5.77,
   "evals": 25,
   "patchLines": 266,
   "produced": true
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "low",
   "tokens": 60826,
   "score": 0.0,
   "raw": null,
   "evals": 18,
   "patchLines": 152,
   "produced": false
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "max",
   "tokens": 171826,
   "score": 0.2625,
   "raw": 8.98,
   "evals": 33,
   "patchLines": 652,
   "produced": true
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 74200,
   "score": 0.1512,
   "raw": 6.83,
   "evals": 30,
   "patchLines": 175,
   "produced": true
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "none",
   "tokens": 41219,
   "score": 0.0999,
   "raw": 5.82,
   "evals": 17,
   "patchLines": 37,
   "produced": true
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 77843,
   "score": 0.1041,
   "raw": 5.92,
   "evals": 40,
   "patchLines": 127,
   "produced": true
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "high",
   "tokens": 68958,
   "score": 0.1404,
   "raw": 6.62,
   "evals": 5,
   "patchLines": 26,
   "produced": true
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "low",
   "tokens": 17258,
   "score": 0.0984,
   "raw": 5.54,
   "evals": 2,
   "patchLines": 0,
   "produced": true
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "max",
   "tokens": 98724,
   "score": 0.1088,
   "raw": 6.01,
   "evals": 23,
   "patchLines": 279,
   "produced": true
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 21490,
   "score": 0.1005,
   "raw": 5.85,
   "evals": 9,
   "patchLines": 11,
   "produced": true
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "none",
   "tokens": 727,
   "score": 0.0984,
   "raw": 5.54,
   "evals": 1,
   "patchLines": 0,
   "produced": true
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 90253,
   "score": 0.1062,
   "raw": 5.96,
   "evals": 10,
   "patchLines": 74,
   "produced": true
  },
  {
   "task": "ddpo_sd15_aesthetic",
   "taskShort": "DDPO",
   "family": "diffusion RL",
   "model": "kimi-k3",
   "modelLabel": "Kimi K3",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 56000,
   "score": 0.2656,
   "raw": 9.04,
   "evals": 6,
   "patchLines": 544,
   "produced": true
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "high",
   "tokens": 126274,
   "score": 0.1014,
   "raw": 65.7,
   "evals": 11,
   "patchLines": 692,
   "produced": true
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "low",
   "tokens": 201311,
   "score": 0.1055,
   "raw": 65.4,
   "evals": 11,
   "patchLines": 669,
   "produced": true
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 179101,
   "score": 0.1137,
   "raw": 64.8,
   "evals": 19,
   "patchLines": 453,
   "produced": true
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "medium",
   "tokens": 151148,
   "score": 0.1,
   "raw": 65.8,
   "evals": 13,
   "patchLines": 602,
   "produced": true
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "xhigh",
   "tokens": 163358,
   "score": 0.1,
   "raw": 65.8,
   "evals": 10,
   "patchLines": 689,
   "produced": true
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "high",
   "tokens": 127042,
   "score": 0.0989,
   "raw": 66.5,
   "evals": 0,
   "patchLines": 168,
   "produced": true
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "low",
   "tokens": 80002,
   "score": 0.0992,
   "raw": 66.3,
   "evals": 0,
   "patchLines": 53,
   "produced": true
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 168616,
   "score": 0.0994,
   "raw": 66.2,
   "evals": 11,
   "patchLines": 299,
   "produced": true
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "medium",
   "tokens": 97102,
   "score": 0.1055,
   "raw": 65.4,
   "evals": 1,
   "patchLines": 136,
   "produced": true
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "xhigh",
   "tokens": 128398,
   "score": 0.0988,
   "raw": 66.6,
   "evals": 11,
   "patchLines": 217,
   "produced": true
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "high",
   "tokens": 75702,
   "score": 0.0976,
   "raw": 67.4,
   "evals": 25,
   "patchLines": 35,
   "produced": true
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "low",
   "tokens": 3539,
   "score": 0.0,
   "raw": null,
   "evals": 2,
   "patchLines": 0,
   "produced": false
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "max",
   "tokens": 103040,
   "score": 0.1068,
   "raw": 65.3,
   "evals": 16,
   "patchLines": 42,
   "produced": true
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 14512,
   "score": 0.0994,
   "raw": 66.2,
   "evals": 6,
   "patchLines": 8,
   "produced": true
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "none",
   "tokens": 5113,
   "score": 0.0,
   "raw": null,
   "evals": 3,
   "patchLines": 8,
   "produced": false
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 63244,
   "score": 0.0963,
   "raw": 68.3,
   "evals": 24,
   "patchLines": 59,
   "produced": true
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "high",
   "tokens": 65766,
   "score": 0.0997,
   "raw": 66.0,
   "evals": 20,
   "patchLines": 52,
   "produced": true
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "low",
   "tokens": 45484,
   "score": 0.0984,
   "raw": 66.9,
   "evals": 16,
   "patchLines": 24,
   "produced": true
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "max",
   "tokens": 114246,
   "score": 0.0998,
   "raw": 65.9,
   "evals": 28,
   "patchLines": 213,
   "produced": true
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 49252,
   "score": 0.1041,
   "raw": 65.5,
   "evals": 14,
   "patchLines": 63,
   "produced": true
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "none",
   "tokens": 17745,
   "score": 0.0982,
   "raw": 67.0,
   "evals": 14,
   "patchLines": 88,
   "produced": true
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 82327,
   "score": 0.1287,
   "raw": 63.7,
   "evals": 20,
   "patchLines": 67,
   "produced": true
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "high",
   "tokens": 49065,
   "score": 0.0,
   "raw": null,
   "evals": 24,
   "patchLines": 141,
   "produced": false
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "low",
   "tokens": 5047,
   "score": 0.1068,
   "raw": 65.3,
   "evals": 1,
   "patchLines": 5,
   "produced": true
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "max",
   "tokens": 146943,
   "score": 0.0941,
   "raw": 69.9,
   "evals": 29,
   "patchLines": 136,
   "produced": true
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 28798,
   "score": 0.1205,
   "raw": 64.3,
   "evals": 9,
   "patchLines": 23,
   "produced": true
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "none",
   "tokens": 763,
   "score": 0.0,
   "raw": null,
   "evals": 1,
   "patchLines": 0,
   "produced": false
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 59328,
   "score": 0.1027,
   "raw": 65.6,
   "evals": 8,
   "patchLines": 9,
   "produced": true
  },
  {
   "task": "digress_qm9_graph_diffusion",
   "taskShort": "DiGress",
   "family": "discrete graph diffusion",
   "model": "kimi-k3",
   "modelLabel": "Kimi K3",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 89376,
   "score": 0.1082,
   "raw": 65.2,
   "evals": 7,
   "patchLines": 255,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "high",
   "tokens": 80912,
   "score": 0.3984,
   "raw": 0.615,
   "evals": 10,
   "patchLines": 1178,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "low",
   "tokens": 88237,
   "score": 0.1672,
   "raw": 0.467,
   "evals": 17,
   "patchLines": 337,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 114090,
   "score": 0.1828,
   "raw": 0.477,
   "evals": 13,
   "patchLines": 232,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "medium",
   "tokens": 97695,
   "score": 0.4094,
   "raw": 0.622,
   "evals": 13,
   "patchLines": 1177,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "xhigh",
   "tokens": 117360,
   "score": 0.0993,
   "raw": 0.421,
   "evals": 9,
   "patchLines": 437,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "high",
   "tokens": 63815,
   "score": 0.2813,
   "raw": 0.54,
   "evals": 0,
   "patchLines": 89,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "low",
   "tokens": 73418,
   "score": 0.0953,
   "raw": 0.404,
   "evals": 3,
   "patchLines": 94,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 82788,
   "score": 0.2844,
   "raw": 0.542,
   "evals": 5,
   "patchLines": 56,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "medium",
   "tokens": 67847,
   "score": 0.0943,
   "raw": 0.4,
   "evals": 6,
   "patchLines": 39,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "xhigh",
   "tokens": 100300,
   "score": 0.2281,
   "raw": 0.506,
   "evals": 0,
   "patchLines": 266,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "high",
   "tokens": 32112,
   "score": 0.0948,
   "raw": 0.402,
   "evals": 4,
   "patchLines": 49,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "low",
   "tokens": 10486,
   "score": 0.175,
   "raw": 0.472,
   "evals": 1,
   "patchLines": 6,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "max",
   "tokens": 70522,
   "score": 0.2703,
   "raw": 0.533,
   "evals": 13,
   "patchLines": 100,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 25584,
   "score": 0.2062,
   "raw": 0.492,
   "evals": 6,
   "patchLines": 14,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "none",
   "tokens": 4714,
   "score": 0.096,
   "raw": 0.407,
   "evals": 3,
   "patchLines": 26,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 67462,
   "score": 0.3187,
   "raw": 0.564,
   "evals": 9,
   "patchLines": 59,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "high",
   "tokens": 63073,
   "score": 0.1531,
   "raw": 0.458,
   "evals": 5,
   "patchLines": 159,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "low",
   "tokens": 25097,
   "score": 0.1109,
   "raw": 0.431,
   "evals": 9,
   "patchLines": 41,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "max",
   "tokens": 79227,
   "score": 0.1188,
   "raw": 0.436,
   "evals": 8,
   "patchLines": 140,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 39438,
   "score": 0.2094,
   "raw": 0.494,
   "evals": 12,
   "patchLines": 87,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "none",
   "tokens": 45305,
   "score": 0.0943,
   "raw": 0.4,
   "evals": 3,
   "patchLines": 21,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 62879,
   "score": 0.1906,
   "raw": 0.482,
   "evals": 11,
   "patchLines": 210,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "high",
   "tokens": 62697,
   "score": 0.2094,
   "raw": 0.494,
   "evals": 6,
   "patchLines": 54,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "low",
   "tokens": 12473,
   "score": 0.0993,
   "raw": 0.421,
   "evals": 2,
   "patchLines": 46,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "max",
   "tokens": 173526,
   "score": 0.1563,
   "raw": 0.46,
   "evals": 7,
   "patchLines": 307,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 22022,
   "score": 0.1375,
   "raw": 0.448,
   "evals": 2,
   "patchLines": 30,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "none",
   "tokens": 2041,
   "score": 0.1297,
   "raw": 0.443,
   "evals": 1,
   "patchLines": 12,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 91124,
   "score": 0.1219,
   "raw": 0.438,
   "evals": 7,
   "patchLines": 219,
   "produced": true
  },
  {
   "task": "dpo_preference_alignment",
   "taskShort": "DPO",
   "family": "preference optimization",
   "model": "kimi-k3",
   "modelLabel": "Kimi K3",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 55068,
   "score": 0.2844,
   "raw": 0.542,
   "evals": 6,
   "patchLines": 226,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "high",
   "tokens": 153106,
   "score": 0.1229,
   "raw": 0.694,
   "evals": 9,
   "patchLines": 1922,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "low",
   "tokens": 155494,
   "score": 0.1287,
   "raw": 0.696,
   "evals": 12,
   "patchLines": 1736,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 129920,
   "score": 0.1229,
   "raw": 0.694,
   "evals": 5,
   "patchLines": 1053,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "medium",
   "tokens": 132938,
   "score": 0.1287,
   "raw": 0.696,
   "evals": 9,
   "patchLines": 2012,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "xhigh",
   "tokens": 140032,
   "score": 0.1287,
   "raw": 0.696,
   "evals": 8,
   "patchLines": 2303,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "high",
   "tokens": 151899,
   "score": 0.1229,
   "raw": 0.694,
   "evals": 0,
   "patchLines": 840,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "low",
   "tokens": 109900,
   "score": 0.1344,
   "raw": 0.698,
   "evals": 6,
   "patchLines": 720,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 136024,
   "score": 0.1373,
   "raw": 0.699,
   "evals": 5,
   "patchLines": 524,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "medium",
   "tokens": 111360,
   "score": 0.1201,
   "raw": 0.693,
   "evals": 3,
   "patchLines": 483,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "xhigh",
   "tokens": 164078,
   "score": 0.1229,
   "raw": 0.694,
   "evals": 1,
   "patchLines": 593,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "high",
   "tokens": 55709,
   "score": 0.1229,
   "raw": 0.694,
   "evals": 7,
   "patchLines": 230,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "low",
   "tokens": 5763,
   "score": 0.1229,
   "raw": 0.694,
   "evals": 1,
   "patchLines": 4,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "max",
   "tokens": 56538,
   "score": 0.1229,
   "raw": 0.694,
   "evals": 42,
   "patchLines": 291,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 28714,
   "score": 0.1229,
   "raw": 0.694,
   "evals": 9,
   "patchLines": 87,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "none",
   "tokens": 10581,
   "score": 0.1229,
   "raw": 0.694,
   "evals": 4,
   "patchLines": 61,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 108300,
   "score": 0.1172,
   "raw": 0.692,
   "evals": 14,
   "patchLines": 273,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "high",
   "tokens": 73803,
   "score": 0.1315,
   "raw": 0.697,
   "evals": 13,
   "patchLines": 650,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "low",
   "tokens": 45948,
   "score": 0.1229,
   "raw": 0.694,
   "evals": 19,
   "patchLines": 562,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "max",
   "tokens": 183747,
   "score": 0.143,
   "raw": 0.701,
   "evals": 34,
   "patchLines": 1709,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 61331,
   "score": 0.1258,
   "raw": 0.695,
   "evals": 18,
   "patchLines": 278,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "none",
   "tokens": 25027,
   "score": 0.1229,
   "raw": 0.694,
   "evals": 11,
   "patchLines": 506,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 74814,
   "score": 0.1172,
   "raw": 0.692,
   "evals": 14,
   "patchLines": 384,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "high",
   "tokens": 87939,
   "score": 0.1229,
   "raw": 0.694,
   "evals": 10,
   "patchLines": 338,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "low",
   "tokens": 16039,
   "score": 0.1229,
   "raw": 0.694,
   "evals": 2,
   "patchLines": 99,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "max",
   "tokens": 180879,
   "score": 0.1229,
   "raw": 0.694,
   "evals": 14,
   "patchLines": 816,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 22571,
   "score": 0.1229,
   "raw": 0.694,
   "evals": 5,
   "patchLines": 134,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "none",
   "tokens": 981,
   "score": 0.0,
   "raw": null,
   "evals": 1,
   "patchLines": 0,
   "produced": false
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 91216,
   "score": 0.1229,
   "raw": 0.694,
   "evals": 7,
   "patchLines": 403,
   "produced": true
  },
  {
   "task": "model_soup_clip_imagenetv2",
   "taskShort": "Model Soup",
   "family": "weight averaging",
   "model": "kimi-k3",
   "modelLabel": "Kimi K3",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 70118,
   "score": 0.1229,
   "raw": 0.694,
   "evals": 7,
   "patchLines": 931,
   "produced": true
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "high",
   "tokens": 86710,
   "score": 0.1207,
   "raw": 0.449,
   "evals": 1,
   "patchLines": 271,
   "produced": true
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "low",
   "tokens": 98486,
   "score": 0.0966,
   "raw": 0.421,
   "evals": 1,
   "patchLines": 168,
   "produced": true
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 135243,
   "score": 0.0899,
   "raw": 0.392,
   "evals": 6,
   "patchLines": 432,
   "produced": true
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "medium",
   "tokens": 87105,
   "score": 0.0991,
   "raw": 0.432,
   "evals": 5,
   "patchLines": 259,
   "produced": true
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "xhigh",
   "tokens": 106132,
   "score": 0.1064,
   "raw": 0.44,
   "evals": 6,
   "patchLines": 219,
   "produced": true
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "high",
   "tokens": 63156,
   "score": 0.0979,
   "raw": 0.427,
   "evals": 7,
   "patchLines": 44,
   "produced": true
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "low",
   "tokens": 63355,
   "score": 0.0991,
   "raw": 0.432,
   "evals": 4,
   "patchLines": 46,
   "produced": true
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 54805,
   "score": 0.0982,
   "raw": 0.428,
   "evals": 3,
   "patchLines": 18,
   "produced": true
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "medium",
   "tokens": 64292,
   "score": 0.0979,
   "raw": 0.427,
   "evals": 7,
   "patchLines": 35,
   "produced": true
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "xhigh",
   "tokens": 61599,
   "score": 0.0966,
   "raw": 0.421,
   "evals": 1,
   "patchLines": 18,
   "produced": true
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "high",
   "tokens": 74908,
   "score": 0.0972,
   "raw": 0.424,
   "evals": 6,
   "patchLines": 2,
   "produced": true
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "low",
   "tokens": 11651,
   "score": 0.0,
   "raw": null,
   "evals": 4,
   "patchLines": 0,
   "produced": false
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "max",
   "tokens": 95392,
   "score": 0.0993,
   "raw": 0.433,
   "evals": 10,
   "patchLines": 4,
   "produced": true
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 22915,
   "score": 0.1032,
   "raw": 0.438,
   "evals": 7,
   "patchLines": 6,
   "produced": true
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "none",
   "tokens": 4707,
   "score": 0.0991,
   "raw": 0.432,
   "evals": 2,
   "patchLines": 4,
   "produced": true
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 57588,
   "score": 0.0979,
   "raw": 0.427,
   "evals": 11,
   "patchLines": 7,
   "produced": true
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "high",
   "tokens": 51944,
   "score": 0.0972,
   "raw": 0.424,
   "evals": 8,
   "patchLines": 8,
   "produced": true
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "low",
   "tokens": 50063,
   "score": 0.1016,
   "raw": 0.437,
   "evals": 15,
   "patchLines": 21,
   "produced": true
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "max",
   "tokens": 115002,
   "score": 0.0984,
   "raw": 0.429,
   "evals": 14,
   "patchLines": 34,
   "produced": true
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 29679,
   "score": 0.0986,
   "raw": 0.43,
   "evals": 9,
   "patchLines": 24,
   "produced": true
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "none",
   "tokens": 34644,
   "score": 0.0977,
   "raw": 0.426,
   "evals": 8,
   "patchLines": 14,
   "produced": true
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 101759,
   "score": 0.0959,
   "raw": 0.418,
   "evals": 15,
   "patchLines": 12,
   "produced": true
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "high",
   "tokens": 106876,
   "score": 0.0,
   "raw": null,
   "evals": 18,
   "patchLines": 0,
   "produced": false
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "low",
   "tokens": 24307,
   "score": 0.0,
   "raw": null,
   "evals": 6,
   "patchLines": 0,
   "produced": false
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "max",
   "tokens": 210243,
   "score": 0.0998,
   "raw": 0.435,
   "evals": 10,
   "patchLines": 113,
   "produced": true
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 39810,
   "score": 0.1112,
   "raw": 0.443,
   "evals": 4,
   "patchLines": 6,
   "produced": true
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "none",
   "tokens": 751,
   "score": 0.0,
   "raw": null,
   "evals": 1,
   "patchLines": 0,
   "produced": false
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 87685,
   "score": 0.0993,
   "raw": 0.433,
   "evals": 6,
   "patchLines": 4,
   "produced": true
  },
  {
   "task": "opd_math_1p5b",
   "taskShort": "OPD",
   "family": "on-policy distillation",
   "model": "kimi-k3",
   "modelLabel": "Kimi K3",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 49634,
   "score": 0.0929,
   "raw": 0.405,
   "evals": 2,
   "patchLines": 25,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "high",
   "tokens": 143571,
   "score": 0.1,
   "raw": 0.12743,
   "evals": 21,
   "patchLines": 1302,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "low",
   "tokens": 138826,
   "score": 0.1112,
   "raw": 0.13829,
   "evals": 17,
   "patchLines": 1831,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 156593,
   "score": 0.0978,
   "raw": 0.12457,
   "evals": 21,
   "patchLines": 1390,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "medium",
   "tokens": 125624,
   "score": 0.0946,
   "raw": 0.12057,
   "evals": 17,
   "patchLines": 1379,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "xhigh",
   "tokens": 170164,
   "score": 0.1006,
   "raw": 0.128,
   "evals": 21,
   "patchLines": 2240,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "high",
   "tokens": 88108,
   "score": 0.0884,
   "raw": 0.11257,
   "evals": 10,
   "patchLines": 352,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "low",
   "tokens": 97661,
   "score": 0.0848,
   "raw": 0.108,
   "evals": 5,
   "patchLines": 342,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 156994,
   "score": 0.0884,
   "raw": 0.11257,
   "evals": 4,
   "patchLines": 469,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "medium",
   "tokens": 97056,
   "score": 0.0,
   "raw": null,
   "evals": 6,
   "patchLines": 164,
   "produced": false
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "xhigh",
   "tokens": 126637,
   "score": 0.0893,
   "raw": 0.11371,
   "evals": 12,
   "patchLines": 282,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "high",
   "tokens": 36243,
   "score": 0.0955,
   "raw": 0.12171,
   "evals": 5,
   "patchLines": 26,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "low",
   "tokens": 9443,
   "score": 0.0906,
   "raw": 0.11543,
   "evals": 3,
   "patchLines": 21,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "max",
   "tokens": 63268,
   "score": 0.0911,
   "raw": 0.116,
   "evals": 16,
   "patchLines": 98,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 27418,
   "score": 0.0982,
   "raw": 0.12514,
   "evals": 6,
   "patchLines": 83,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "none",
   "tokens": 27092,
   "score": 0.0987,
   "raw": 0.12571,
   "evals": 2,
   "patchLines": 18,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 72345,
   "score": 0.0987,
   "raw": 0.12571,
   "evals": 8,
   "patchLines": 123,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "high",
   "tokens": 54814,
   "score": 0.0991,
   "raw": 0.12629,
   "evals": 10,
   "patchLines": 178,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "low",
   "tokens": 24603,
   "score": 0.0996,
   "raw": 0.12686,
   "evals": 6,
   "patchLines": 56,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "max",
   "tokens": 107001,
   "score": 0.0991,
   "raw": 0.12629,
   "evals": 25,
   "patchLines": 408,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 46717,
   "score": 0.0973,
   "raw": 0.124,
   "evals": 16,
   "patchLines": 109,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "none",
   "tokens": 31627,
   "score": 0.0906,
   "raw": 0.11543,
   "evals": 7,
   "patchLines": 19,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 101349,
   "score": 0.0978,
   "raw": 0.12457,
   "evals": 22,
   "patchLines": 431,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "high",
   "tokens": 102181,
   "score": 0.0848,
   "raw": 0.108,
   "evals": 12,
   "patchLines": 64,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "low",
   "tokens": 38038,
   "score": 0.0996,
   "raw": 0.12686,
   "evals": 3,
   "patchLines": 36,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "max",
   "tokens": 136155,
   "score": 0.0996,
   "raw": 0.12686,
   "evals": 13,
   "patchLines": 384,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 15182,
   "score": 0.0991,
   "raw": 0.12629,
   "evals": 2,
   "patchLines": 44,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "none",
   "tokens": 945,
   "score": 0.0754,
   "raw": 0.096,
   "evals": 1,
   "patchLines": 16,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 133159,
   "score": 0.1,
   "raw": 0.12743,
   "evals": 22,
   "patchLines": 291,
   "produced": true
  },
  {
   "task": "openr1_code_livecodebench",
   "taskShort": "OpenR1",
   "family": "supervised fine-tuning",
   "model": "kimi-k3",
   "modelLabel": "Kimi K3",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 30026,
   "score": 0.0776,
   "raw": 0.09886,
   "evals": 1,
   "patchLines": 95,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "high",
   "tokens": 191587,
   "score": 0.195,
   "raw": 1.0134,
   "evals": 14,
   "patchLines": 1550,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "low",
   "tokens": 140950,
   "score": 0.1822,
   "raw": 0.9965,
   "evals": 17,
   "patchLines": 1365,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 123527,
   "score": 0.2068,
   "raw": 1.0291,
   "evals": 13,
   "patchLines": 1445,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "medium",
   "tokens": 136725,
   "score": 0.195,
   "raw": 1.0135,
   "evals": 18,
   "patchLines": 1476,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "xhigh",
   "tokens": 87504,
   "score": 0.2033,
   "raw": 1.0245,
   "evals": 14,
   "patchLines": 623,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "high",
   "tokens": 108325,
   "score": 0.0826,
   "raw": 0.7329,
   "evals": 12,
   "patchLines": 46,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "low",
   "tokens": 109900,
   "score": 0.1611,
   "raw": 0.9685,
   "evals": 0,
   "patchLines": 36,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 83186,
   "score": 0.1456,
   "raw": 0.9479,
   "evals": 18,
   "patchLines": 51,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "medium",
   "tokens": 85438,
   "score": 0.1615,
   "raw": 0.969,
   "evals": 2,
   "patchLines": 38,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "xhigh",
   "tokens": 108444,
   "score": 0.1569,
   "raw": 0.9628,
   "evals": 0,
   "patchLines": 70,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "high",
   "tokens": 56412,
   "score": 0.1773,
   "raw": 0.9899,
   "evals": 29,
   "patchLines": 51,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "low",
   "tokens": 16284,
   "score": 0.0,
   "raw": null,
   "evals": 14,
   "patchLines": 5,
   "produced": false
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "max",
   "tokens": 110740,
   "score": 0.1433,
   "raw": 0.9448,
   "evals": 27,
   "patchLines": 37,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 20335,
   "score": 0.0843,
   "raw": 0.7482,
   "evals": 6,
   "patchLines": 32,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "none",
   "tokens": 17034,
   "score": 0.1369,
   "raw": 0.9363,
   "evals": 22,
   "patchLines": 31,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 70292,
   "score": 0.1521,
   "raw": 0.9565,
   "evals": 28,
   "patchLines": 56,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "high",
   "tokens": 82337,
   "score": 0.1592,
   "raw": 0.9659,
   "evals": 30,
   "patchLines": 328,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "low",
   "tokens": 31328,
   "score": 0.0841,
   "raw": 0.746,
   "evals": 12,
   "patchLines": 24,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "max",
   "tokens": 113456,
   "score": 0.1835,
   "raw": 0.9982,
   "evals": 18,
   "patchLines": 147,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 54121,
   "score": 0.1831,
   "raw": 0.9976,
   "evals": 11,
   "patchLines": 85,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "none",
   "tokens": 41411,
   "score": 0.18,
   "raw": 0.9935,
   "evals": 42,
   "patchLines": 84,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 81100,
   "score": 0.2067,
   "raw": 1.029,
   "evals": 57,
   "patchLines": 595,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "high",
   "tokens": 82586,
   "score": 0.1827,
   "raw": 0.9971,
   "evals": 25,
   "patchLines": 87,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "low",
   "tokens": 24931,
   "score": 0.1488,
   "raw": 0.9521,
   "evals": 12,
   "patchLines": 25,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "max",
   "tokens": 89781,
   "score": 0.1501,
   "raw": 0.9538,
   "evals": 14,
   "patchLines": 58,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 32348,
   "score": 0.1253,
   "raw": 0.9209,
   "evals": 18,
   "patchLines": 45,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "none",
   "tokens": 6193,
   "score": 0.0803,
   "raw": 0.7126,
   "evals": 12,
   "patchLines": 21,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 403,
   "score": 0.1267,
   "raw": 0.9228,
   "evals": 0,
   "patchLines": 0,
   "produced": true
  },
  {
   "task": "openunlearning_tofu_npo_llama3p2_1b",
   "taskShort": "NPO",
   "family": "machine unlearning",
   "model": "kimi-k3",
   "modelLabel": "Kimi K3",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 79241,
   "score": 0.1746,
   "raw": 0.9863,
   "evals": 29,
   "patchLines": 1256,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "high",
   "tokens": 95557,
   "score": 0.4162,
   "raw": 13.2,
   "evals": 20,
   "patchLines": 1118,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "low",
   "tokens": 98726,
   "score": 0.4197,
   "raw": 13.0,
   "evals": 17,
   "patchLines": 1165,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 133246,
   "score": 0.4197,
   "raw": 13.0,
   "evals": 19,
   "patchLines": 1362,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "medium",
   "tokens": 92458,
   "score": 0.4128,
   "raw": 13.4,
   "evals": 12,
   "patchLines": 1157,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "xhigh",
   "tokens": 160742,
   "score": 0.4145,
   "raw": 13.3,
   "evals": 14,
   "patchLines": 1594,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "high",
   "tokens": 102305,
   "score": 0.3037,
   "raw": 21.7,
   "evals": 12,
   "patchLines": 746,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "low",
   "tokens": 95210,
   "score": 0.0989,
   "raw": 54.0,
   "evals": 12,
   "patchLines": 441,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 135886,
   "score": 0.3981,
   "raw": 14.3,
   "evals": 10,
   "patchLines": 658,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "medium",
   "tokens": 107312,
   "score": 0.3256,
   "raw": 19.7,
   "evals": 0,
   "patchLines": 796,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "xhigh",
   "tokens": 71368,
   "score": 0.309,
   "raw": 21.2,
   "evals": 16,
   "patchLines": 196,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "high",
   "tokens": 43527,
   "score": 0.2366,
   "raw": 29.2,
   "evals": 30,
   "patchLines": 170,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "low",
   "tokens": 5583,
   "score": 0.1104,
   "raw": 51.0,
   "evals": 4,
   "patchLines": 72,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "max",
   "tokens": 71762,
   "score": 0.3256,
   "raw": 19.7,
   "evals": 22,
   "patchLines": 343,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 27032,
   "score": 0.2966,
   "raw": 22.4,
   "evals": 16,
   "patchLines": 137,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "none",
   "tokens": 7941,
   "score": 0.1495,
   "raw": 42.9,
   "evals": 7,
   "patchLines": 58,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 53638,
   "score": 0.3699,
   "raw": 16.2,
   "evals": 20,
   "patchLines": 332,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "high",
   "tokens": 47572,
   "score": 0.4145,
   "raw": 13.3,
   "evals": 20,
   "patchLines": 311,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "low",
   "tokens": 64931,
   "score": 0.3888,
   "raw": 14.9,
   "evals": 23,
   "patchLines": 228,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "max",
   "tokens": 97087,
   "score": 0.3537,
   "raw": 17.4,
   "evals": 31,
   "patchLines": 552,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 85314,
   "score": 0.3755,
   "raw": 15.8,
   "evals": 49,
   "patchLines": 396,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "none",
   "tokens": 33100,
   "score": 0.3122,
   "raw": 20.9,
   "evals": 17,
   "patchLines": 168,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 70084,
   "score": 0.4045,
   "raw": 13.9,
   "evals": 38,
   "patchLines": 435,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "high",
   "tokens": 52140,
   "score": 0.3843,
   "raw": 15.2,
   "evals": 13,
   "patchLines": 298,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "low",
   "tokens": 11238,
   "score": 0.3177,
   "raw": 20.4,
   "evals": 5,
   "patchLines": 49,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "max",
   "tokens": 154547,
   "score": 0.3843,
   "raw": 15.2,
   "evals": 18,
   "patchLines": 595,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 18590,
   "score": 0.3199,
   "raw": 20.2,
   "evals": 6,
   "patchLines": 132,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "none",
   "tokens": 630,
   "score": 0.0,
   "raw": null,
   "evals": 1,
   "patchLines": 0,
   "produced": false
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 177708,
   "score": 0.3699,
   "raw": 16.2,
   "evals": 19,
   "patchLines": 621,
   "produced": true
  },
  {
   "task": "owl_wanda_opt6p7b_70pct",
   "taskShort": "OWL",
   "family": "one-shot pruning",
   "model": "kimi-k3",
   "modelLabel": "Kimi K3",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 55937,
   "score": 0.3981,
   "raw": 14.3,
   "evals": 6,
   "patchLines": 491,
   "produced": true
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "high",
   "tokens": 119032,
   "score": 1.0,
   "raw": 1.0,
   "evals": 14,
   "patchLines": 1607,
   "produced": true
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "low",
   "tokens": 92396,
   "score": 1.0,
   "raw": 1.0,
   "evals": 10,
   "patchLines": 1156,
   "produced": true
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 105790,
   "score": 0.1694,
   "raw": 0.234,
   "evals": 12,
   "patchLines": 342,
   "produced": true
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "medium",
   "tokens": 152205,
   "score": 1.0,
   "raw": 1.0,
   "evals": 22,
   "patchLines": 1360,
   "produced": true
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "xhigh",
   "tokens": 119802,
   "score": 0.1445,
   "raw": 0.211,
   "evals": 7,
   "patchLines": 347,
   "produced": true
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "high",
   "tokens": 151288,
   "score": 0.8861,
   "raw": 0.895,
   "evals": 14,
   "patchLines": 563,
   "produced": true
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "low",
   "tokens": 73604,
   "score": 0.0253,
   "raw": 0.043,
   "evals": 3,
   "patchLines": 185,
   "produced": true
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 69959,
   "score": 0.1672,
   "raw": 0.232,
   "evals": 2,
   "patchLines": 111,
   "produced": true
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "medium",
   "tokens": 123006,
   "score": 0.0,
   "raw": 0.0,
   "evals": 10,
   "patchLines": 248,
   "produced": true
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "xhigh",
   "tokens": 107531,
   "score": 0.1759,
   "raw": 0.24,
   "evals": 6,
   "patchLines": 114,
   "produced": true
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "high",
   "tokens": 30744,
   "score": 0.0735,
   "raw": 0.125,
   "evals": 11,
   "patchLines": 32,
   "produced": true
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "low",
   "tokens": 4197,
   "score": 0.0906,
   "raw": 0.154,
   "evals": 1,
   "patchLines": 13,
   "produced": true
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "max",
   "tokens": 89553,
   "score": 0.0,
   "raw": null,
   "evals": 17,
   "patchLines": 100,
   "produced": false
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 22512,
   "score": 0.0,
   "raw": null,
   "evals": 10,
   "patchLines": 23,
   "produced": false
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "none",
   "tokens": 13545,
   "score": 0.0,
   "raw": null,
   "evals": 4,
   "patchLines": 37,
   "produced": false
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 93206,
   "score": 0.0,
   "raw": null,
   "evals": 16,
   "patchLines": 62,
   "produced": false
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "high",
   "tokens": 77116,
   "score": 1.0,
   "raw": 1.0,
   "evals": 10,
   "patchLines": 782,
   "produced": true
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "low",
   "tokens": 52956,
   "score": 0.8731,
   "raw": 0.883,
   "evals": 25,
   "patchLines": 232,
   "produced": true
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "max",
   "tokens": 162666,
   "score": 1.0,
   "raw": 1.0,
   "evals": 16,
   "patchLines": 1307,
   "produced": true
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 81389,
   "score": 0.0,
   "raw": null,
   "evals": 25,
   "patchLines": 523,
   "produced": false
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "none",
   "tokens": 16162,
   "score": 0.054,
   "raw": 0.0918,
   "evals": 10,
   "patchLines": 31,
   "produced": true
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 112338,
   "score": 0.511,
   "raw": 0.549,
   "evals": 10,
   "patchLines": 804,
   "produced": true
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "high",
   "tokens": 36390,
   "score": 0.0505,
   "raw": 0.0859,
   "evals": 4,
   "patchLines": 101,
   "produced": true
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "low",
   "tokens": 13888,
   "score": 0.0,
   "raw": null,
   "evals": 3,
   "patchLines": 9,
   "produced": false
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "max",
   "tokens": 227157,
   "score": 0.9978,
   "raw": 0.998,
   "evals": 28,
   "patchLines": 1445,
   "produced": true
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 14503,
   "score": 0.1152,
   "raw": 0.184,
   "evals": 1,
   "patchLines": 17,
   "produced": true
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "none",
   "tokens": 6171,
   "score": 0.1553,
   "raw": 0.221,
   "evals": 5,
   "patchLines": 7,
   "produced": true
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 130570,
   "score": 0.2041,
   "raw": 0.266,
   "evals": 9,
   "patchLines": 345,
   "produced": true
  },
  {
   "task": "ragen_sokoban_grpo",
   "taskShort": "RAGEN",
   "family": "multi-turn agentic RL",
   "model": "kimi-k3",
   "modelLabel": "Kimi K3",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 58081,
   "score": 0.1173,
   "raw": 0.186,
   "evals": 5,
   "patchLines": 68,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "high",
   "tokens": 129387,
   "score": 0.088,
   "raw": 71.9,
   "evals": 19,
   "patchLines": 916,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "low",
   "tokens": 120510,
   "score": 0.0867,
   "raw": 71.6,
   "evals": 30,
   "patchLines": 1089,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 144999,
   "score": 0.1287,
   "raw": 75.7,
   "evals": 32,
   "patchLines": 946,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "medium",
   "tokens": 125701,
   "score": 0.1789,
   "raw": 77.1,
   "evals": 41,
   "patchLines": 508,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "harness": "Claude Code",
   "effort": "xhigh",
   "tokens": 161464,
   "score": 0.0578,
   "raw": 64.4,
   "evals": 42,
   "patchLines": 677,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "high",
   "tokens": 100482,
   "score": 0.0984,
   "raw": 74.5,
   "evals": 2,
   "patchLines": 118,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "low",
   "tokens": 119248,
   "score": 0.0775,
   "raw": 69.3,
   "evals": 2,
   "patchLines": 604,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 103293,
   "score": 0.1,
   "raw": 74.9,
   "evals": 10,
   "patchLines": 591,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "medium",
   "tokens": 80254,
   "score": 0.0863,
   "raw": 71.5,
   "evals": 0,
   "patchLines": 472,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "harness": "Claude Code",
   "effort": "xhigh",
   "tokens": 84483,
   "score": 0.0,
   "raw": 38.3,
   "evals": 10,
   "patchLines": 434,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "high",
   "tokens": 34656,
   "score": 0.0964,
   "raw": 74.0,
   "evals": 16,
   "patchLines": 27,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "low",
   "tokens": 9426,
   "score": 0.0984,
   "raw": 74.5,
   "evals": 4,
   "patchLines": 8,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "max",
   "tokens": 33459,
   "score": 0.098,
   "raw": 74.4,
   "evals": 6,
   "patchLines": 42,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 32446,
   "score": 0.1323,
   "raw": 75.8,
   "evals": 9,
   "patchLines": 10,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "none",
   "tokens": 16980,
   "score": 0.1143,
   "raw": 75.3,
   "evals": 3,
   "patchLines": 12,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 59594,
   "score": 0.1179,
   "raw": 75.4,
   "evals": 12,
   "patchLines": 49,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "high",
   "tokens": 52779,
   "score": 0.0964,
   "raw": 74.0,
   "evals": 8,
   "patchLines": 115,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "low",
   "tokens": 34992,
   "score": 0.0964,
   "raw": 74.0,
   "evals": 16,
   "patchLines": 55,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "max",
   "tokens": 104592,
   "score": 0.096,
   "raw": 73.9,
   "evals": 28,
   "patchLines": 557,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 85259,
   "score": 0.0952,
   "raw": 73.7,
   "evals": 26,
   "patchLines": 335,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "none",
   "tokens": 64246,
   "score": 0.1108,
   "raw": 75.2,
   "evals": 21,
   "patchLines": 42,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 64503,
   "score": 0.0956,
   "raw": 73.8,
   "evals": 22,
   "patchLines": 233,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "high",
   "tokens": 83096,
   "score": 0.1179,
   "raw": 75.4,
   "evals": 5,
   "patchLines": 19,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "low",
   "tokens": 19275,
   "score": 0.092,
   "raw": 72.9,
   "evals": 2,
   "patchLines": 18,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "max",
   "tokens": 150771,
   "score": 0.0679,
   "raw": 66.9,
   "evals": 16,
   "patchLines": 505,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "medium",
   "tokens": 22508,
   "score": 0.0968,
   "raw": 74.1,
   "evals": 3,
   "patchLines": 9,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "none",
   "tokens": 846,
   "score": 0.1108,
   "raw": 75.2,
   "evals": 1,
   "patchLines": 8,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "harness": "Codex",
   "effort": "xhigh",
   "tokens": 53396,
   "score": 0.0839,
   "raw": 70.9,
   "evals": 10,
   "patchLines": 148,
   "produced": true
  },
  {
   "task": "ultrafeedback_bt_rm_rewardbench",
   "taskShort": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "model": "kimi-k3",
   "modelLabel": "Kimi K3",
   "harness": "Claude Code",
   "effort": "max",
   "tokens": 64751,
   "score": 0.0968,
   "raw": 74.1,
   "evals": 10,
   "patchLines": 406,
   "produced": true
  }
 ],
 "tasks": [
  {
   "id": "openr1_code_livecodebench",
   "short": "OpenR1",
   "family": "supervised fine-tuning",
   "metric": "livecodebench_v6_pass_at_1_full175",
   "direction": "\u2191",
   "baseline": "0.1274",
   "mean": 0.091
  },
  {
   "id": "ragen_sokoban_grpo",
   "short": "RAGEN",
   "family": "multi-turn agentic RL",
   "metric": "held_out_512_board_solve_rate",
   "direction": "\u2191",
   "baseline": "0.170",
   "mean": 0.338
  },
  {
   "id": "opd_math_1p5b",
   "short": "OPD",
   "family": "on-policy distillation",
   "metric": "aime24_25_at32",
   "direction": "\u2191",
   "baseline": "0.436",
   "mean": 0.086
  },
  {
   "id": "ultrafeedback_bt_rm_rewardbench",
   "short": "BTRM",
   "family": "Bradley-Terry reward modeling",
   "metric": "rewardbench_v1_score",
   "direction": "\u2191",
   "baseline": "74.9",
   "mean": 0.097
  },
  {
   "id": "dpo_preference_alignment",
   "short": "DPO",
   "family": "preference optimization",
   "metric": "ifeval_strict_accuracy_hidden413",
   "direction": "\u2191",
   "baseline": "0.424",
   "mean": 0.187
  },
  {
   "id": "ddpo_sd15_aesthetic",
   "short": "DDPO",
   "family": "diffusion RL",
   "metric": "mean_aesthetic_score_final256",
   "direction": "\u2191",
   "baseline": "5.84",
   "mean": 0.171
  },
  {
   "id": "openunlearning_tofu_npo_llama3p2_1b",
   "short": "NPO",
   "family": "machine unlearning",
   "metric": "balanced_unlearning_score",
   "direction": "ext\u2193 / MU\u2191",
   "baseline": "0.8873",
   "mean": 0.151
  },
  {
   "id": "digress_qm9_graph_diffusion",
   "short": "DiGress",
   "family": "discrete graph diffusion",
   "metric": "qm9_test_nll",
   "direction": "\u2193",
   "baseline": "65.8",
   "mean": 0.089
  },
  {
   "id": "model_soup_clip_imagenetv2",
   "short": "Model Soup",
   "family": "weight averaging",
   "metric": "imagenetv2_top1_full10000",
   "direction": "\u2191",
   "baseline": "0.686",
   "mean": 0.121
  },
  {
   "id": "owl_wanda_opt6p7b_70pct",
   "short": "OWL",
   "family": "one-shot pruning",
   "metric": "wikitext2_test_perplexity",
   "direction": "\u2193",
   "baseline": "53.4",
   "mean": 0.325
  }
 ],
 "configurations": [
  {
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "effort": "low",
   "harness": "Claude Code",
   "cost": 181.27,
   "mean": 0.2722,
   "tokens": 1217197
  },
  {
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "effort": "medium",
   "harness": "Claude Code",
   "cost": 166.31,
   "mean": 0.2881,
   "tokens": 1203134
  },
  {
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "effort": "high",
   "harness": "Claude Code",
   "cost": 181.09,
   "mean": 0.2776,
   "tokens": 1212462
  },
  {
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "effort": "xhigh",
   "harness": "Claude Code",
   "cost": 184.67,
   "mean": 0.1898,
   "tokens": 1340403
  },
  {
   "model": "claude-opus-5",
   "modelLabel": "Claude Opus 5",
   "effort": "max",
   "harness": "Claude Code",
   "cost": 195.47,
   "mean": 0.2245,
   "tokens": 1342697
  },
  {
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "effort": "low",
   "harness": "Claude Code",
   "cost": 93.07,
   "mean": 0.0991,
   "tokens": 907902
  },
  {
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "effort": "medium",
   "harness": "Claude Code",
   "cost": 97.75,
   "mean": 0.1092,
   "tokens": 914026
  },
  {
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "effort": "high",
   "harness": "Claude Code",
   "cost": 95.53,
   "mean": 0.216,
   "tokens": 1028536
  },
  {
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "effort": "xhigh",
   "harness": "Claude Code",
   "cost": 100.78,
   "mean": 0.137,
   "tokens": 1024626
  },
  {
   "model": "claude-sonnet-5",
   "modelLabel": "Claude Sonnet 5",
   "effort": "max",
   "harness": "Claude Code",
   "cost": 108.62,
   "mean": 0.1635,
   "tokens": 1098601
  },
  {
   "model": "kimi-k3",
   "modelLabel": "Kimi K3",
   "effort": "max",
   "harness": "Claude Code",
   "cost": 29.93,
   "mean": 0.1738,
   "tokens": 608232
  },
  {
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "effort": "none",
   "harness": "Codex",
   "cost": 339.34,
   "mean": 0.1261,
   "tokens": 350486
  },
  {
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "effort": "low",
   "harness": "Codex",
   "cost": 336.86,
   "mean": 0.1976,
   "tokens": 436228
  },
  {
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "effort": "medium",
   "harness": "Codex",
   "cost": 448.69,
   "mean": 0.144,
   "tokens": 606700
  },
  {
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "effort": "high",
   "harness": "Codex",
   "cost": 419.93,
   "mean": 0.235,
   "tokens": 624516
  },
  {
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "effort": "xhigh",
   "harness": "Codex",
   "cost": 521.2,
   "mean": 0.1952,
   "tokens": 828996
  },
  {
   "model": "gpt-5.6-sol",
   "modelLabel": "GPT-5.6 Sol",
   "effort": "max",
   "harness": "Codex",
   "cost": 626.19,
   "mean": 0.2455,
   "tokens": 1248850
  },
  {
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "effort": "none",
   "harness": "Codex",
   "cost": 3.53,
   "mean": 0.065,
   "tokens": 20048
  },
  {
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "effort": "low",
   "harness": "Codex",
   "cost": 34.56,
   "mean": 0.1085,
   "tokens": 182494
  },
  {
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "effort": "medium",
   "harness": "Codex",
   "cost": 43.34,
   "mean": 0.1349,
   "tokens": 237822
  },
  {
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "effort": "high",
   "harness": "Codex",
   "cost": 213.87,
   "mean": 0.1293,
   "tokens": 731928
  },
  {
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "effort": "xhigh",
   "harness": "Codex",
   "cost": 228.57,
   "mean": 0.1438,
   "tokens": 914842
  },
  {
   "model": "gpt-5.6-terra",
   "modelLabel": "GPT-5.6 Terra",
   "effort": "max",
   "harness": "Codex",
   "cost": 345.99,
   "mean": 0.2282,
   "tokens": 1568726
  },
  {
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "effort": "none",
   "harness": "Codex",
   "cost": 16.91,
   "mean": 0.0914,
   "tokens": 119027
  },
  {
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "effort": "low",
   "harness": "Codex",
   "cost": 6.51,
   "mean": 0.0786,
   "tokens": 83703
  },
  {
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "effort": "medium",
   "harness": "Codex",
   "cost": 30.35,
   "mean": 0.1242,
   "tokens": 256594
  },
  {
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "effort": "high",
   "harness": "Codex",
   "cost": 65.93,
   "mean": 0.1191,
   "tokens": 503183
  },
  {
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "effort": "xhigh",
   "harness": "Codex",
   "cost": 109.89,
   "mean": 0.1468,
   "tokens": 708496
  },
  {
   "model": "gpt-5.6-luna",
   "modelLabel": "GPT-5.6 Luna",
   "effort": "max",
   "harness": "Codex",
   "cost": 107.87,
   "mean": 0.1393,
   "tokens": 770128
  }
 ],
 "systems": [
  {
   "id": "claude-opus-5",
   "label": "Claude Opus 5",
   "mean": 0.25,
   "cells": 50
  },
  {
   "id": "gpt-5.6-sol",
   "label": "GPT-5.6 Sol",
   "mean": 0.191,
   "cells": 60
  },
  {
   "id": "kimi-k3",
   "label": "Kimi K3",
   "mean": 0.174,
   "cells": 10
  },
  {
   "id": "claude-sonnet-5",
   "label": "Claude Sonnet 5",
   "mean": 0.145,
   "cells": 50
  },
  {
   "id": "gpt-5.6-terra",
   "label": "GPT-5.6 Terra",
   "mean": 0.135,
   "cells": 60
  },
  {
   "id": "gpt-5.6-luna",
   "label": "GPT-5.6 Luna",
   "mean": 0.117,
   "cells": 60
  }
 ],
 "efforts": [
  {
   "id": "none",
   "mean": 0.094,
   "cells": 30
  },
  {
   "id": "low",
   "mean": 0.151,
   "cells": 50
  },
  {
   "id": "medium",
   "mean": 0.16,
   "cells": 50
  },
  {
   "id": "high",
   "mean": 0.195,
   "cells": 50
  },
  {
   "id": "xhigh",
   "mean": 0.163,
   "cells": 50
  },
  {
   "id": "max",
   "mean": 0.196,
   "cells": 60
  }
 ],
 "overall": {
  "mean": 0.166,
  "cells": 290,
  "belowBaseline": 124
 }
}