MITHRIL AnalysisEnglish

EDUCATIONAL MEASUREMENTS

初回の48応答を、証跡と一緒に公開する

2モデル × 8教材 × 3回。合成証拠の判断を測定した公開教材の smoke run。

正式な MFCI スコア・frontier 順位ではありません。公開解答があるため学習汚染を排除できず、CTF・脆弱性修正・実運用能力は測っていません。

Model ID呼出回数decision 一致観測 API 費用 (USD)
openai/gpt-6.1-sol2487 / 960.02624
anthropic/claude-sonnet-5.52484 / 960.03240

96 decision は同じ32判断の3反復です。96個の独立な未知課題ではありません。この表から有意差や順位を主張しません。

測定条件と限界

モデル用 tools・ネットワークなし。reasoning effort low、各出力1024 token、provider fallbackなし。公開解答は入力に含めず、別の既存 grader で採点しました。

要求・応答のモデル ID は一致。immutable weights snapshot は未確認です。費用と経過時間は各応答の記録で確認できます。

2026-10-08T01:06:11.859415+00:00 — 2026-10-08T01:07:58.303376+00:00

入力・応答・採点・費用 JSON ↓Provenance JSON ↓方法と残る検証 ↗

正式評価の次の条件

非公開 holdout、隔離された agent harness、独立 grader、model snapshot と予算の事前登録、paired Mithril comparison を整えてから正式な frontier 評価を公開します。