EDUCATIONAL MEASUREMENTS
初回の48応答を、証跡と一緒に公開する
2モデル × 8教材 × 3回。合成証拠の判断を測定した公開教材の smoke run。
正式な MFCI スコア・frontier 順位ではありません。公開解答があるため学習汚染を排除できず、CTF・脆弱性修正・実運用能力は測っていません。
| Model ID | 呼出回数 | decision 一致 | 観測 API 費用 (USD) |
|---|---|---|---|
| openai/gpt-6.1-sol | 24 | 87 / 96 | 0.02624 |
| anthropic/claude-sonnet-5.5 | 24 | 84 / 96 | 0.03240 |
96 decision は同じ32判断の3反復です。96個の独立な未知課題ではありません。この表から有意差や順位を主張しません。
測定条件と限界
モデル用 tools・ネットワークなし。reasoning effort low、各出力1024 token、provider fallbackなし。公開解答は入力に含めず、別の既存 grader で採点しました。
要求・応答のモデル ID は一致。immutable weights snapshot は未確認です。費用と経過時間は各応答の記録で確認できます。
2026-10-08T01:06:11.859415+00:00 — 2026-10-08T01:07:58.303376+00:00
正式評価の次の条件
非公開 holdout、隔離された agent harness、独立 grader、model snapshot と予算の事前登録、paired Mithril comparison を整えてから正式な frontier 評価を公開します。