AIの知能はどう測るのか 正答率・汎化・理解をめぐる研究史
学習データへの混入、失敗の分布、TruthfulQA、HELM、ARC。高得点と万能性を分け、AIの進歩を実験条件とともに捉えます。
最近追加された記事を新しい順に確認できます。
学習データへの混入、失敗の分布、TruthfulQA、HELM、ARC。高得点と万能性を分け、AIの進歩を実験条件とともに捉えます。
推論時の計算、候補の生成と検証、AlphaGeometry、AlphaProof。2024年と2025年の成果を、形式化や制限時間の違いとともにたどります。
学習済みの知識と外部検索、根拠の確認、Toolformer、ReAct。長い作業の成功率や権限の境界から、モデル単体とシステムの違いを説明します。
回答の実演、人による比較、報酬モデル、DPO。文章の続きを作る能力を依頼に応える能力へ変える方法と、迎合や評価のずれを解説します。
分類から生成へ、識別器との競争からノイズ除去へ。CLIPが結ぶ画像と文章、生成の美しさと条件への正確さの違いまで説明します。
モデル・データ・計算の配分、GPT-3の文脈内学習、Chinchilla、創発と採点。大規模化の成果と、規模だけでは決まらない能力を扱います。
自己注意、位置の情報、並列学習を解説。BERTの穴埋めとGPTの次トークン予測を比較し、構造と学習目標の違いを整理します。
word2vec、文脈、seq2seq、注意機構の発展。単語を番号で扱うことと、関係を計算できる表現で扱うことの違いを具体例から解説します。
遅れて分かる報酬、探索と活用、DQN、方策と価値、自己対戦。AlphaGoとMuZeroの成果を、学習と探索の組合せから説明します。
画像のデータ基盤、畳み込み、GPU、学習の工夫が合流した2012年。top-1とtop-5の違い、ラベルの限界、転移学習までを解説します。