私たちはモノサシを置く。測るのはあなた。
検証

AA総合指数の版ごとの比重と点数 12件照合

Artificial Analysis Intelligence Index は、運営の告知記事の日付で 2026-08-06 に v4.1.1、2026-09-04 に v4.2、2026-09-07 に v4.3 と版が変わっており、運営のページには、v4.1.1 は評価と比重を v4.1 から変えず、v4.2 では評価の入れ替えと比重の変更、v4.3 では同じ比重のまま評価の入れ替えがあったと書かれています。Claude Fable 5.1 の「57」と GPT-6 Astra の「55」は v4.2 の告知記事の図にある値、両者の「53」は v4.3 の告知記事の値で、どれも Fable 5.1 は max with fallback、Astra は max という推論設定の付いた値です。

この記事は、Artificial Analysis(以下 AA)が公表している総合指数 Intelligence Index について、版ごとに何が入り、どの比重で、どのモデルのどの設定が何点と書かれているかを、AA 自身のページの原文で並べます。どのモデルを選ぶかは扱いません。

最終確認
2026-09-15
確認方法
AA の公開ページ12件を 2026-09-15(日本時間)に取得し、原文と図で読みました。方法論ページと評価ページは、Internet Archive の保存版(v4.1.1 と v4.2 の表示のもの)も読みました。モデルは動かしておらず、指数も計算し直していません
対象
Intelligence Index の v4.1・v4.1.1・v4.2・v4.3 の構成・比重・非公開の割合と、Claude Fable 5.1・GPT-6 Astra の表示値。2つのモデルに絞ったのは、AA が v4.3 の告知記事で `Claude Fable 5.1 and GPT-6 Astra lead the Intelligence Index`、GPT-6 Astra の記事で `GPT-6 Astra ties leadership with Claude Fable 5.1` と、両者を名指しして書いているためです。他のモデルの値は、本文の表の「同じ箇所に書かれた他のモデルと値」の列から読めます
この表示値から言えること・言えないこと
57・55(v4.2)と 53・53(v4.3)は評価の組み合わせが違う版の値として書かれており、この記載からは、その差を同じ物差しでの変化として読むことも、どちらのモデルが優れているかを読むこともできません
57・55
v4.2 の告知記事(2026-09-04)の図
53・53
v4.3 の告知記事(2026-09-07)の本文
過去の保存版
方法論ページと評価ページについて、v4.1.1 の表示の版(保存 2026-09-03 UTC)と v4.2 の表示の版(保存 2026-09-04・09-05 UTC)を読みました。v4.3 期の保存版は読んでいません
更新周期
1か月ごと。版が変わったときも更新します

この記事は何を、どこまで確かめたか

確かめたのは、artificialanalysis.ai の公開ページ12件の記載です。すべて 2026-09-15(日本時間)に直接取得した内容に依拠しています。報道や SNS の投稿は根拠にしていません。5 の方法論ページと 7 の評価ページは、Internet Archive の保存版を2つずつ読み、過去の時点の表示を確かめています(下の2つめの表)。保存日時は UTC で、ページ内の版の表示で v4.1.1 期・v4.2 期を判断しています。

#読んだページ日付の表示何を確かめるために読んだか
1v4.2 の告知記事September 4, 2026変更点、非公開の割合、図の点数と比重
2v4.3 の告知記事September 7, 2026変更点、非公開の割合、点数、比重の表
3v4.1.1 の告知記事August 6, 2026変更点、点数の扱い
4v4.1 の告知記事June 15, 2026比重
5方法論ページ現行の比重、版の履歴、信頼区間
6changelog取得できた項目は 10 Jul 2026〜14 Sept 2026版の更新の日付
7Intelligence Index の評価ページ現行の表示値、区分の比重の記載
8モデルのリーダーボード現行の表示値と推論設定
9Claude Fable 5.1 の記事September 1, 2026公開時の点数、fallback の説明
10GPT-6 Astra の記事September 9, 2026点数の書き方
11Claude Fable 5.1 のモデルページ表示値と推論設定の名前
12GPT-6 Astra のモデルページ表示値
保存版保存日時(UTC)ページ内の版の表示
5 方法論ページ2026-09-03 22:06:43Artificial Analysis Intelligence Index v4.1.1
5 方法論ページ2026-09-05 15:47:51Artificial Analysis Intelligence Index v4.2
7 評価ページ2026-09-03 22:06:29Artificial Analysis Intelligence Index v4.1.1
7 評価ページ2026-09-04 22:33:57Artificial Analysis Intelligence Index v4.2

Intelligence Index は、いつ・どの版に変わったか

告知記事の日付は、v4.1 が 2026-06-15、v4.1.1 が 2026-08-06、v4.2 が 2026-09-04、v4.3 が 2026-09-07 です。方法論ページの版の履歴は v4.3 を「September 2026 to current」と書いており、取得できた changelog の 2026-09-14 までの項目に、v4.3 より後の版の告知は見つけられませんでした。

表は版の日付順です。「非公開の割合」の列は、版ごとに原文の言い方をそのまま書いています。言い方が違うため、同じ定義で数えた値とは限りません。

告知記事(#)changelog の項目外した評価入れた評価版を上げた評価非公開の割合(原文)
v4.12026-06-15(4)取得できた範囲(2026-07-10 以降)の外IFBench(Removed IFBench due to saturation.Terminal-Bench Hard→Terminal-Bench 2.1、τ²-Bench Telecom→τ³-Bench Banking、GDPval-AA→GDPval-AA v2「記載を見つけられなかった」の表を参照
v4.1.12026-08-06(3)06 Aug 2026 に告知記事と方法論の項目𝜏³-Banking を v1.0.1 に。採点に使うモデルを変更同上
v4.22026-09-04(1)04 Sept 2026 に告知記事の項目(方法論の項目は「記載を見つけられなかった」の表を参照)GPQA DiamondAA-Briefcase、GDP.pdfAA-LCR→v1.140% of our Index weighting is now private, held-out test sets - double the figure from v4.1
v4.32026-09-07(2)07 Sept 2026 に告知記事と方法論の項目𝜏³-BankingAutomationBench-AATerminal-Bench v2.1→v4.0Evaluations with private questions or answers account for 45% of the Intelligence Index v4.3 weighting, up from 40% in v4.2.

v4.1.1 について、changelog の項目は The contributing evaluations and their weights are unchanged from v4.1.(訳:構成する評価とその比重は v4.1 から変わっていません)と書いています。3 の記事はこの版を this patch release(訳:このパッチリリース)と呼んでいます。

v4.2 で GPQA Diamond を外したことについて、1 の記事は GPQA Diamond, an exceptional scientific reasoning evaluation that has now been saturated(訳:GPQA Diamond、優れた科学的推論の評価で、いまでは飽和した(saturated)もの)と書いています。

AutomationBench-AA は、AA のページに「追加」と「置き換え」の両方の言い方で書かれています。2 の記事の冒頭は We are upgrading Terminal-Bench to v4 and adding AutomationBench-AA(訳:Terminal-Bench を v4 に上げ、AutomationBench-AA を加えます)です。同じ記事の Changelog の節は Replaced 𝜏³-Banking with AutomationBench-AA(訳:𝜏³-Banking を AutomationBench-AA に置き換え)、比重の説明は AutomationBench-AA replaces 𝜏³-Banking at its 5% weighting.(訳:AutomationBench-AA は 𝜏³-Banking の 5% の比重を引き継いで置き換えます)と書いています。v4.2 の図の評価一覧には 𝜏³-Banking があり、v4.3 の評価一覧には 𝜏³-Banking が無く AutomationBench-AA があります。評価の数は、v4.2 について 1 の記事の本文テキストには無く、図「Artificial Analysis Intelligence Index」の説明文に Artificial Analysis Intelligence Index v4.2 incorporates 10 evaluations とあり、v4.2 の表示の方法論ページの保存版(2026-09-05 15:47:51 UTC)も同じ書き出しの文(評価の並び順は異なる)を載せています。v4.3 については 2 の記事の本文に Artificial Analysis Intelligence Index v4.3 incorporates 10 evaluations とあります。v4.1.1 の表示の方法論ページの保存版(2026-09-03 22:06:43 UTC)は Artificial Analysis Intelligence Index v4.1.1 incorporates 9 evaluations と書いています。

版ごとに、どの評価がどの比重で入っているか

v4.2 と v4.3 は、区分の比重がどちらも Agents 30%・Coding 20%・General 30%・Scientific Reasoning 20% で、評価の入れ替えは 𝜏³-Banking(5%)が AutomationBench-AA(5%)に、Terminal-Bench v2.1(10%)が v4.0(10%)に代わった2か所です。v4.1 と v4.1.1 は区分の比重が Agents 34%・Coding 24%・Scientific Reasoning 24%・General 18% で、GPQA Diamond が 6% で入っていました。一方で、評価ページのよくある質問は、v4.1.1・v4.2・v4.3 の表示のどの時点でも区分の比重を「各25%」と書いており、方法論ページの記載と一致していません。

区分(v4.2・v4.3)評価v4.1・v4.1.1v4.2v4.3「Private test set」(v4.3 の表の分類。v4.2 以前には当てはめない)
AgentsAA-Briefcase15%15%Yes
AgentsGDPval-AA v220%10%10%No
Agents𝜏³-Banking(4 では τ³-Bench Banking)14%5%
AgentsAutomationBench-AA5%Yes
CodingTerminal-Bench 2.1(v2.1)16%10%
CodingTerminal-Bench v4.010%No
CodingSciCode8%10%10%No
GeneralAA-Omniscience Accuracy8%10%10%Yes
GeneralAA-Omniscience Non-Hallucination4%5%5%Yes
GeneralGDP.pdf10%10%No
GeneralAA-LCR(v4.2 以降は v1.1)6%5%5%No
Scientific ReasoningHumanity's Last Exam(HLE)12%10%10%No
Scientific ReasoningCritPt6%10%10%Yes
Scientific Reasoning(v4.1.1 の保存版)GPQA Diamond(4 では GPQA)6%

所在は次のとおりです。v4.1・v4.1.1 の列は、4 の記事の Full Intelligence Index v4.1 weights と、v4.1.1 の表示の方法論ページの保存版(2026-09-03 22:06:43 UTC)の比重の表で、両者の値は同じです。v4.2 の列は、1 の記事の図「Artificial Analysis Intelligence Index v4.2: Evaluation Weights」と、v4.2 の表示の方法論ページの保存版(2026-09-05 15:47:51 UTC)の比重の表で、両者の値は同じです。v4.3 の列は 2 の記事の表「Intelligence Index v4.3 - evaluations, private test sets, and weights」です。現行の 5 の方法論ページの版の履歴にも、v4.2 と v4.3 の評価ごとの比重が同じ値で書かれています。区分の列は、GPQA Diamond の行が v4.1.1 の表示の保存版、それ以外の行が v4.2・v4.3 の区分です。v4.1.1 の表示の保存版では、AA-LCR と AA-Omniscience が General、Terminal-Bench v2.1 と SciCode が Coding、GDPval-AA v2 と 𝜏³-Banking が Agents、HLE と CritPt が Scientific Reasoning に入っています。

区分の比重は、ページによって書き方が違います。

ページ区分の比重の記載(原文)
2 v4.3 の告知記事Category weights are unchanged from v4.2: Agents 30%, Coding 20%, General 30%, Scientific Reasoning 20%.
5 方法論ページ(現行の説明)Agents (30%), Coding (20%), Scientific Reasoning (20%) and General (30%)
5 方法論ページ(v4.2 の表示の保存版、2026-09-05 15:47:51 UTC)Agents (30%), Coding (20%), Scientific Reasoning (20%) and General (30%)
5 方法論ページ(v4.1.1 の表示の保存版、2026-09-03 22:06:43 UTC)Agents (34%), Coding (24%), Scientific Reasoning (24%) and General (18%)
5 方法論ページ(現行の版の履歴 Version 4.1)Agents (34%), Coding (24%), Scientific Reasoning (24%), General (18%)
5 方法論ページ(現行の版の履歴 Version 4.0)Agents (25%), Coding (25%), General (25%), Scientific Reasoning (25%)
7 評価ページ(現行のよくある質問)Four categories each contribute 25%: agents, coding, general capability, and scientific reasoning.
7 評価ページ(v4.2 の表示の保存版、2026-09-04 22:33:57 UTC)同じ文
7 評価ページ(v4.1.1 の表示の保存版、2026-09-03 22:06:29 UTC)同じ文

7 の評価ページは、現行の版では見出しに Artificial Analysis Intelligence Index v4.3、2つの保存版ではそれぞれ Artificial Analysis Intelligence Index v4.2Artificial Analysis Intelligence Index v4.1.1 と表示しています。3つの時点とも、よくある質問の区分の比重は「各25%」の同じ文で、同じ版の表示の方法論ページの記載(v4.2・v4.3 の表示では Agents 30%・Coding 20%・Scientific Reasoning 20%・General 30%、v4.1.1 の表示では Agents 34%・Coding 24%・Scientific Reasoning 24%・General 18%)と一致していません。

非公開の割合の書き方も、版によって違います。

v4.1 の割合の数字は、「記載を見つけられなかったのは、どの項目か」の表に載せています。

5 の方法論ページにある Harvey LAB-AA は、Additional Evaluations(追加の評価)の表に載っており、その節は These are reported separately and are not included in the Intelligence Index score.(訳:これらは別に報告し、Intelligence Index のスコアには含めません)と書いています。

ニュースで見る「57」「55」「53」は、どの版の・どの設定の値か

57 と 55 は、1 の v4.2 の告知記事の図にある Claude Fable 5.1 (max with fallback) と GPT-6 Astra (max) の値です。本文のテキストには数字が無く、図の中に印字されています。v4.2 の表示の評価ページの保存版(2026-09-04 22:33:57 UTC)にも同じ 57 と 55 があります。53 と 53 は、2 の v4.3 の告知記事の本文にある同じ2つの設定の値です。これより前の 2026-09-01 の 9 の記事は Claude Fable 5.1 を max effort で 66 と書いており、v4.1.1 の表示の評価ページの保存版(2026-09-03 22:06:29 UTC)も同じ設定を 66 と表示しています。

表は版の日付順(記事の日付、保存版は保存日時)、同じ所在の中ではモデル名のアルファベット順です。値の大小の順ではありません。

モデル名と推論設定(表示どおり)所在同じ箇所に書かれた他のモデルと値(原文)
66Claude Fable 5.1(At max effort記事に版の記載は見つけられなかった9 の記事の本文(September 1, 2026)Claude Opus 5 (max, 63), Claude Fable 5 (max, 62), GPT-5.6 Sol (max, 61) and Grok 4.6 (high, 61)
66Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)ページの見出しに v4.1.17 の評価ページの保存版(2026-09-03 22:06:29 UTC)followed by Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) with a score of 65 , and Claude Opus 5 (Adaptive Reasoning, Max Effort) with a score of 63
57Claude Fable 5.1 (max with fallback)v4.2(図の説明文に v4.21 の記事の図「Artificial Analysis Intelligence Index」(September 4, 2026)GPT-6 Astra (max) 55、Claude Opus 5 (max) 54、Claude Fable 5 (with fallback) 53、Muse Spark 1.3 (max) 53
55GPT-6 Astra (max)v4.2(同上)同上同上
57Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)ページの見出しに v4.27 の評価ページの保存版(2026-09-04 22:33:57 UTC)followed by GPT-6 Astra (max) with a score of 55 , and GPT-6 Astra (xhigh) with a score of 54
55GPT-6 Astra (max)同上同上同上
53Claude Fable 5.1 (max with fallback)v4.32 の記事の本文(September 7, 2026)followed by Claude Opus 5 (max, 51), Claude Fable 5 (with fallback, 50), Muse Spark 1.3 (max, 48) and GPT-5.6 Sol (max, 47)
53GPT-6 Astra (max)v4.3同上同上
53GPT-6 Astra (max)記事に版の記載は見つけられなかった10 の記事の本文(September 9, 2026)level with Claude Fable 5.1 (max with fallback)

9 の記事の日付(2026-09-01)は、3 の v4.1.1 の告知(2026-08-06)と 1 の v4.2 の告知(2026-09-04)のあいだにあります。現行の 5 の方法論ページの版の履歴は、v4.1.1 の期間を August 2026—September 2026 と書いています。v4.1.1 の表示の方法論ページの保存版(2026-09-03 22:06:43 UTC)の版の履歴は、同じ版を August 2026—current と書いています。

AA は各版の数字を次のように書いています。

2026-09-15 に取得した現行のページでは、53 の行が複数あります。

ページ表示(原文)
7 評価ページClaude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) scores the highest on Artificial Analysis Intelligence Index with a score of 53, followed by Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) with a score of 53 and GPT-6 Astra (max) with a score of 53
8 リーダーボードThe top models by Intelligence Index are: 1. Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (53), 2. Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) (53), 3. GPT-6 Astra (max) (53), 4. GPT-6 Astra (xhigh) (53), 5. Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback) (51).
11 Fable 5.1 のモデルページClaude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) scores 53 on the Artificial Analysis Intelligence Index
12 Astra のモデルページGPT-6 Astra (max) scores 53 on the Artificial Analysis Intelligence Index

11 のモデルページは、ページのタイトルに Claude Fable 5.1 (max with fallback)、見出しに Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) と表示しています。8 のリーダーボードの表の53の行には、Claude Fable 5.1 の max with fallback と xhigh with fallback、GPT-6 Astra の max と xhigh の4つがあります。4つとも表示は整数の 53 です。同じページの HTML に含まれるデータの intelligenceIndex の欄には、この4つの行について小数の値(53.3737509623252、53.1840337538944、52.814069395513、52.5059027108782 の順)が入っています。この欄と表示の 53・並び順との関係の記載については、「記載を見つけられなかったのは、どの項目か」の表に探した範囲を載せています。

5 の方法論ページは、信頼区間を次のように書いています。

We estimate a 95% confidence interval for Artificial Analysis Intelligence Index of less than ±1% - based on experiments with >10 repeats on certain models for all evaluation datasets included in Artificial Analysis Intelligence Index v4.3 .

訳:Artificial Analysis Intelligence Index の95%信頼区間は ±1% 未満と推定しています。これは、Artificial Analysis Intelligence Index v4.3 に含まれるすべての評価データセットについて、特定のモデルで10回を超える繰り返しを行った実験に基づきます。

「特定のモデル(certain models)」の中身と ±1% の単位も、同じ表に載せています。

「with fallback」「Default Fallback」について、9 の記事は次のように書いています。

We evaluated the model with Anthropic's 'default' server-side fallback, which routes safety-flagged requests to Claude Opus 4.8 or Claude Opus 5; fallback served ~4% of output tokens across the Intelligence Index.

訳:このモデルは、Anthropic の「default」のサーバー側 fallback を有効にして評価しました。これは安全面で印の付いたリクエストを Claude Opus 4.8 または Claude Opus 5 に回すもので、Intelligence Index 全体の出力トークンの約4%を fallback が処理しました。

同じ設定について、日付の違うページに違う値が表示されています。6 の changelog は、01 Sept 2026 の項目で Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) の値を Intelligence Index: 53、03 Sept 2026 の項目で GPT-6 Astra (max) の値を Intelligence Index: 53 と表示しています(2026-09-15 取得時)。同じ日付の 9 の記事は Fable 5.1 の max effort を 66、翌日の 1 の図は Astra (max) を 55 としています。7 の評価ページでは、同じ Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) の表示が、v4.1.1 の表示の保存版で 66、v4.2 の表示の保存版で 57、2026-09-15 取得の v4.3 の表示で 53 です。changelog の過去の項目の値がいつ表示されるようになったかの記載は、「記載を見つけられなかった」の表を参照してください。

同じ GPT-6 Astra について、Intelligence Index に含まれない単一のベンチマークの結果の測定条件を扱った記事が別にあります(ARC-AGI-3 人間並みの条件 公式9件照合)。

手元の総合スコアが、どの版の値かを確かめるには何を見ればよいか

手元の数字に書かれている情報によって、照合先が変わります。版・日付・推論設定のどれが書かれているかを見て、この記事の表と AA のページに当てることができます。

手元の数字に書かれているもの照合先分かること
版(v4.2 など)「いつ・どの版に変わったか」の表、比重の表その版に入っていた評価と比重
日付だけ告知記事の日付(2026-08-06、2026-09-04、2026-09-07)その日付がどの告知のあいだにあるか
モデル名だけで推論設定が無い8 のリーダーボード、11・12 のモデルページ同じモデル名で設定違いの行がいくつあり、それぞれ現行で何点と表示されているか
「with fallback」「Default Fallback」9 の記事の fallback の説明その設定で何が行われたと AA が書いているか
順位を示す言い方1・2・10 の記事、7 の評価ページAA がその数字をどう書いたか(leadsscore 53Ties for first placescores the highest

運営は、v4.2 と v4.3 をどういう更新だと書いているか

AA は v4.2 を v5 の要素を前倒しする interim update(暫定の更新)と書き、v4.3 を「Intelligence Index v5 の展開の続き」と書いています。v5 の公開時期を示した記載は、1・2・5 のページには見つけられませんでした。

1 v4.2 の記事

We are accelerating elements of our upcoming v5 release with interim updates to keep pace with the frontier.

訳:最先端の動きに合わせるため、今後の v5 リリースの要素を、暫定の更新(interim updates)によって前倒ししています。

We have deliberately held back updates to keep the Index stable through recent major model launches. However, with the frontier moving so quickly in the past weeks, we feel it is important to deliver an immediate interim update to ensure our Index remains as relevant and useful as ever to users.

訳:最近の主要なモデルの発表のあいだ、指数を安定させるために更新を意図的に控えてきました。しかし、ここ数週間で最先端がこれほど速く動いているため、指数が利用者にとって変わらず有用であり続けるよう、ただちに暫定の更新(interim update)を出すことが大切だと考えています。

Beyond this interim update, our team is hard at work on v5 of the Index. We are planning more incremental releases in the near future.

訳:この暫定の更新(interim update)とは別に、チームは指数の v5 に取り組んでいます。近いうちに、さらに段階的なリリースを予定しています。

同じ記事は The held-out percentage will increase further in Index v5.(訳:保持しているデータの割合は Index v5 でさらに上がります)とも書いています。

2 v4.3 の記事

This is a continuation of our rollout of Intelligence Index v5.

訳:これは Intelligence Index v5 の展開の続きです。

We are continuing to prioritize keeping Intelligence Index as useful as possible by bringing forward a subset of the changes we had planned for Index v5.

訳:Index v5 に向けて計画していた変更の一部を前倒しすることで、Intelligence Index をできるだけ有用に保つことを引き続き優先しています。

版が違う点数を並べて比べられるか、運営は何と書いているか

版をまたいで Intelligence Index の点数を比べられるかどうかを直接述べた文は、1〜5・7 のページには見つけられませんでした。見つかったのは、v4.1.1 の記事の「公表スコアは v4.1.1 に切り替わった」という文と、個別の評価(AA-LCR)について「v1.0 とは直接比べられない」とする文です。

3 v4.1.1 の記事

Published scores are now using v4.1.1, so all model results on Artificial Analysis now reflect these changes and use our latest consistent, independent methodology.

訳:公表しているスコアは v4.1.1 を使うようになったため、Artificial Analysis 上のすべてのモデルの結果が今回の変更を反映し、最新の一貫した独立の方法を用いています。

同じ記事は Overall model rankings remain largely consistent, with a slight increase in scores due to improved grading robustness across the updated evaluations.(訳:モデルの全体の順位はおおむね変わらず、更新した評価で採点の頑健さが改善したためスコアがわずかに上がりました)と書いています。1 の v4.2 と 2 の v4.3 の記事に、これと同じ趣旨の「公表スコアを新しい版に切り替えた」という文は見つけられませんでした。

5 の方法論ページは、AA-LCR v1.1 について Scores are not directly comparable with v1.0.(訳:スコアは v1.0 と直接比べられません)と書いています。これは個別の評価についての文で、指数全体についての文ではありません。

記載を見つけられなかったのは、どの項目か

見つけられなかったのは、v4.1 と v4.1.1 の非公開の割合の数字、v4.2 の非公開 40% の評価ごとの内訳の数字、v4.2 の方法論の changelog の項目、v5 の時期、版をまたいだ指数の比較についての文、changelog の過去の項目の値の扱い、53 の行の並び順の根拠と HTML の小数の値との関係、信頼区間の対象モデルと単位、9・10 の記事の版の10項目です。下の表の範囲で探しました。

項目探したページ探した語
v4.1 の非公開の割合の数字4privateheld-out%
v4.1.1 の非公開の割合の数字3(「Read the latest」の欄の他の記事の要約文は除く)、6 の 06 Aug 2026 の項目privateheld-out
v4.2 の非公開 40% の評価ごとの内訳の数字1(図を含む)、5 の v4.2 の表示の保存版privateheld-out40%
v4.2 の方法論の changelog の項目6(10 Jul〜14 Sept 2026 の項目)Intelligence Index methodologyv4.2
v5 の公開時期1・2・5v5
版をまたいだ指数の比較1〜5・7comparablePublished scoresall model resultsreflect
changelog の過去の項目の値がいつ表示されたか3・6Published scoresIntelligence Index:
53 の行の並び順の根拠と、HTML の intelligenceIndex の小数の値と表示値・並び順の関係5・7・8(評価の課題文・採点の指示の中の出現は除く)highestranks#1rounddecimal
信頼区間の「certain models」の中身と ±1% の単位5confidence intervalcertain models
9・10 の記事が依拠する版9・10(ページ末尾の「Read the latest」に並ぶ他の記事の見出しと要約文は除く)Index v4.v4.1.1v4.2v4.3

9・10 のページには Index v4. の文字列がありますが、いずれも「Read the latest」の欄の他の記事の見出しと要約文(Announcing the Artificial Analysis Intelligence Index v4.3 など)です。10 の本文にある Terminal-Bench v4.0 は評価の版で、指数の版ではありません。

5 の方法論ページと 7 の評価ページについて、v4.3 の表示の期間の保存版は読んでいません。v4.3 の表示は 2026-09-15 取得の現行のページに依拠しており、最終確認日は 2026-09-15 です。

この記載から何が言えて、何が言えないか

言えるのは、57・55 と 53・53 が、入っている評価の組み合わせが違う版の値として書かれていることと、推論設定の書かれていない「Claude Fable 5.1」の数字は、現行の表示でも47〜53の5つの行のどれか特定できないことまでです。どのモデルが優れているか、表示上 53 の行どうしにどういう順序があるかは、この記載からは言えません。

言えることは、次の5つです。

  1. 57・55(v4.2)と 53・53(v4.3)は、評価の組み合わせが違う版の値である。v4.3 では 𝜏³-Banking(5%)が AutomationBench-AA(5%)に、Terminal-Bench v2.1(10%)が v4.0(10%)に代わっています
  2. このため、57 と 53 の差を、同じ評価の組み合わせで測った値の差として読むことは、この記載からはできない
  3. 同じモデル名に、推論設定の違う行が複数ある。6 の changelog には Claude Fable 5.1 の Low・Medium・High・Xhigh・Max の5つの行が 47〜53、GPT-6 Astra の low・medium・high・xhigh・max の5つの行が 46〜53 と表示されています
  4. Claude Fable 5.1 の max の設定には、66(9 の記事、v4.1.1 の表示の評価ページの保存版)、57(1 の図、v4.2 の表示の評価ページの保存版)、53(2 の記事と現行のページ)の3つの値が、版の表示の違うページに書かれている
  5. 非公開の割合の40%と45%は、原文の言い方が違う。v4.2 は private, held-out test sets、v4.3 は private questions or answersprivate tasks or answers です

言えないことは、次の5つです。

  1. Claude Fable 5.1 と GPT-6 Astra のどちらが優れているか、どちらが業務に向くか。指数の値と個別の業務との対応は、今回読んだページに書かれていません
  2. 表示上 53 の行どうしの順序。表示は整数で、信頼区間の対象モデルと ±1% の単位が明示されていません。8 のリーダーボードの HTML に含まれるデータの intelligenceIndex の欄には小数の値が入っていますが、この欄と表示値・並び順との関係を AA が説明した記載は、前節の表の範囲では見つけられませんでした
  3. v4.1 の非公開の割合が何%だったか。1 の記事は「v4.1 の倍」と書いていますが、v4.1 の数字は前節の表の範囲では見つけられませんでした
  4. 版の変更と、特定のモデルの評価の追加との関係。AA が理由として書いているのは、前節で引いた with the frontier moving so quickly in the past weeks などの文です
  5. v5 がいつ公開され、何が変わるか。We are planning more incremental releases in the near future. のほかに、時期を示した記載は前節の表の範囲では見つけられませんでした

この記事はどう更新するか

この記事は1か月ごとに、changelog に新しい版の項目が足されていないか、方法論ページの比重と版の履歴、評価ページとリーダーボードの表示値と推論設定、今回「見つけられなかった」とした10項目を照合し、変わった点を書き換えます。版が変わった場合は新しい記事を立てず、この記事の表に行を足します。最終確認日は冒頭に記載しています。

記載に誤りがある場合、また確認してほしい項目がある場合はお問い合わせからご連絡ください。

この記事は何を出典にしているか

  1. Artificial Analysis|Announcing Artificial Analysis Intelligence Index v4.2(September 4, 2026)(2026-09-15 取得、HTTP 200。図を含む)
  2. Artificial Analysis|Announcing the Artificial Analysis Intelligence Index v4.3(September 7, 2026)(2026-09-15 取得、HTTP 200)
  3. Artificial Analysis|Launching v4.1.1 of the Artificial Analysis Intelligence Index(August 6, 2026)(2026-09-15 取得、HTTP 200)
  4. Artificial Analysis|Announcing Artificial Analysis Intelligence Index v4.1(June 15, 2026)(2026-09-15 取得、HTTP 200)
  5. Artificial Analysis|Intelligence Benchmarking Methodology(2026-09-15 取得、HTTP 200。保存版も使用:2026-09-03 22:06:43 UTC(v4.1.1 の表示)2026-09-05 15:47:51 UTC(v4.2 の表示)。いずれも HTTP 200)
  6. Artificial Analysis|Changelog(2026-09-15 取得、HTTP 200。取得できた項目は 10 Jul 2026〜14 Sept 2026)
  7. Artificial Analysis|Artificial Analysis Intelligence Index v4.3(評価ページ)(2026-09-15 取得、HTTP 200。保存版も使用:2026-09-03 22:06:29 UTC(v4.1.1 の表示)2026-09-04 22:33:57 UTC(v4.2 の表示)。いずれも HTTP 200)
  8. Artificial Analysis|LLM Leaderboard(2026-09-15 取得、HTTP 200)
  9. Artificial Analysis|Claude Fable 5.1 tops the Artificial Analysis Intelligence Index(September 1, 2026)(2026-09-15 取得、HTTP 200)
  10. Artificial Analysis|Benchmarking GPT-6 Astra(September 9, 2026)(2026-09-15 取得、HTTP 200)
  11. Artificial Analysis|Claude Fable 5.1 のモデルページ(2026-09-15 取得、HTTP 200)
  12. Artificial Analysis|GPT-6 Astra のモデルページ(2026-09-15 取得、HTTP 200)
  13. artificialanalysis.ai/robots.txt(2026-09-15 取得、HTTP 200)
Copyright © NISHIMURA Co., Ltd. All Rights Reserved.