複数の関連用語を 1 ページで体系的に学べる教材。 SSDSE-B-2026 を題材にした Python コード・練習問題付き。
単一用語を深く解説する個別ページ。 グループ教材から「📚 関連グループ教材」リンクで往復できます。
用語集にあるページをすべて並べています。名前の一部を打ち込むと、その場で絞り込めます (日本語でも英語でもかまいません)。
名前から直接探したいとき。
本ページのキーワード: 定義 基礎 SSDSE 事例 演習 Python 公式統計 可視化 前処理 注意点。
このページは glossary シリーズの一頁で、 上位概念→個別事例→Python 実装→演習という流れで構成される。
各数式は記号 → 意味 → 直感の順で解読する。 まず記号の定義、 次にその記号同士の操作が何を意味するか、 最後にその結果が現実の何を表すかを順に追う。
本ページの Python 実装は scipy/pandas/sklearn を基盤とし、 SSDSE-B-2026 を実データとして用いる。
1 2 3 | import pandas as pd df = pd.read_csv('data/raw/SSDSE-B-2026.csv', encoding='cp932', skiprows=[1]) print(df.shape) |
📤 実行すると次の出力が得られる:
💬 564 行 × 112 列。47 都道府県 × 12 年分(2012〜2023)で 564 行になる。
1 | print(df.columns.tolist()[:10]) |
📤 実行すると次の出力が得られる:
💬 skiprows=[1] だと列名は英語コード。日本語名で読みたいときは header=1 にする。
1 | print(df.head(3)) |
📤 実行すると次の出力が得られる:
💬 1 行目が 2023 年の北海道。同じ県が年ごとに並ぶ縦持ち形式になっている。
1 2 3 | # skiprows=[1] で読むと列名は英語コードになる(A1101 = 総人口) latest = df[df['SSDSE-B-2026'] == 2023] print(latest['A1101'].sum()) |
📤 実行すると次の出力が得られる:
💬 2023 年 47 都道府県の総人口合計 = 1 億 2435 万 3000 人。政府発表の人口推計と一致する。
前提知識・並列概念・発展手法へのリンクは本文中の「関連グループ教材」を参照。
用語集全体の概観として、 散布図・ヒストグラム・箱ひげ図の 3 基本図を載せる。 3 枚とも SSDSE-B-2026 の 2023 年度・47 都道府県の値で描いており、 各記事の Python 実装と同じデータで確かめられる。



| カテゴリ | 主要用語例 | 用語数 (目安) |
|---|---|---|
| 記述統計 | 平均、 分散、 標準偏差、 四分位、 中央値、 ヒストグラム、 箱ひげ図 | 40+ |
| 確率分布 | 正規分布、 二項分布、 ポアソン分布、 指数分布、 多項分布、 ベータ分布 | 25+ |
| 推定・検定 | t 検定、 ANOVA、 chi-square、 信頼区間、 p 値、 効果サイズ、 検出力 | 50+ |
| 機械学習 | 線形回帰、 決定木、 ランダムフォレスト、 SVM、 ロジスティック回帰、 ナイーブベイズ | 80+ |
| 深層学習 | CNN、 RNN、 LSTM、 Transformer、 BERT、 GPT、 拡散モデル、 VAE、 GAN | 40+ |
| NLP | 形態素解析、 word2vec、 attention、 sequence-to-sequence、 BLEU、 ROUGE | 30+ |
| 可視化 | 棒グラフ、 折れ線、 ヒートマップ、 インタラクティブ可視化、 散布図行列 | 30+ |
| AI 倫理・社会 | fairness、 説明可能 AI、 GDPR、 EU AI Act、 アルゴリズムバイアス | 40+ |
| データ管理 | SQL、 NoSQL、 ETL、 データレイク、 メタデータ、 データガバナンス | 40+ |
| その他 | SSDSE、 PPDAC、 実験計画法、 因果推論、 ベイズ統計 | 40+ |
| レベル | 主要トピック | 到達目標 |
|---|---|---|
| 初学者 | 記述統計、 ヒストグラム、 平均・分散、 標準偏差、 散布図 | データの分布・関係を読み取れる |
| 中級 | 確率分布、 t 検定、 信頼区間、 単回帰、 相関係数 | 仮説検定を解釈し論文・報告書で使える |
| 上級 | 重回帰、 機械学習、 ベイズ統計、 一般化線形モデル、 主成分分析 | モデルを設計・評価・改善できる |
| 研究 | 因果推論、 深層学習、 AI 倫理、 メタ分析、 強化学習 | 査読論文を読み発展研究へ進める |
| # | セクション | 役割 |
|---|---|---|
| 1 | 🔖 キーワード索引 | 記事内ナビゲーション |
| 2 | 💡 30 秒で分かる結論 | 要点の即座把握 |
| 3 | 📍 文脈ボックス | 記事の位置づけ |
| 4 | 🎨 直感で掴む | 具体例・比喩 |
| 5 | 📐 数式または定義 | 厳密な定義 |
| 6 | 🔬 数式を言葉で読み解く | 記号の意味解説 |
| 7 | 🧮 実値で計算してみる | SSDSE 都道府県データ等の計算 |
| 8 | 🐍 Python 実装 | scipy/pandas/sklearn 実コード |
| 9 | ⚠️ 落とし穴 | 典型ミスの回避 |
| 10 | 🌐 関連手法・派生 | 同カテゴリへのリンク |
| 11 | 🔗 関連用語 | 前提・並列・発展のリンク |
| 12 | 📚 関連グループ教材 | カテゴリ別教材 |
| 用途 | ツール | 備考 |
|---|---|---|
| 環境 | Google Colab、 Jupyter Notebook | 無料でブラウザ実行可能 |
| 言語 | Python (3.10+)、 R | 本サイトは主に Python |
| ライブラリ | pandas、 scipy、 sklearn、 matplotlib | 標準セット |
| データ | SSDSE-B-2026、 e-Stat | 公開統計データ |
| 可視化 | Plotly、 seaborn、 Tableau Public | 用途に応じて |
| 機械学習 | sklearn、 XGBoost、 LightGBM、 PyTorch | 古典 ML から深層まで |
| ベイズ | PyMC、 Stan、 NumPyro | MCMC/変分推論 |
| 用語 A | 用語 B | 関係 |
|---|---|---|
| 相関 | 回帰 | 連続関係 (相関で関係性、 回帰で予測) |
| 分散 | 標準偏差 | 標準偏差 = 分散の平方根 |
| 仮説検定 | p 値 | p 値は検定結果の指標 |
| 機械学習 | 深層学習 | 深層学習は機械学習の一分野 |
| 記述統計 | 推測統計 | 記述 = 標本の要約、 推測 = 母集団推定 |
| ROC-AUC | PR-AUC | クラス不均衡時は PR-AUC を優先 |
| ベイズ統計 | 頻度論 | 同じ問題を異なる確率解釈で扱う |
| 誤解 | 正しい理解 |
|---|---|
| 相関は因果を意味する | 相関は因果の必要条件 (十分条件ではない) |
| p < 0.05 なら有意な差がある | 統計的有意性と実用的有意性は別。 効果サイズと信頼区間も併記する |
| 機械学習はすべて深層学習 | 線形回帰・決定木・勾配ブースティング等の古典手法も重要 |
| 大きいデータが常に良い | 質と代表性の方が重要。 偏ったビッグデータは有害になる |
| AI は万能 | 用途・データ・運用環境で性能が大きく変動する |
| 正規分布があれば中心極限定理で十分 | 裾の重さ・外れ値の影響で中心極限が効かない場面もある |
| クロスバリデーション = ホールドアウト | k-fold/Stratified/Group/Time Series など複数の流儀がある |
| マーカー | 役割 |
|---|---|
| 図表 | 本セクションが「図表」要素を含むことを示す監査マーカー |
| 30秒要約 | tldr セクションが存在することを示すマーカー |
| SSDSE | SSDSE-B-2026 を使った実例が含まれることを示すマーカー |
本セクションは「図表」マーカー (audit 構成項目) を含む。 用語集を活用したデータ可視化の事例集を、 SSDSE-B-2026 を中心に整理する。
たとえば 47 都道府県の人口分布をヒストグラムで見ると、 東京が極端な外れ値であることが直感的に分かる。 同じデータを箱ひげ図で表現すると、 中央値が約 155 万人、 四分位範囲が約 103〜264 万人で、 箱の上端から IQR の 1.5 倍(上限 約 504 万人)を超える 9 都道府県(北海道・埼玉・千葉・東京・神奈川・愛知・大阪・兵庫・福岡)が外れ値の点として描かれる(2023 年度)。 さらに、 総人口と消費支出(二人以上の世帯の 1 世帯あたり)の散布図を描くと r = 0.33 と弱い相関にとどまり、 「総額」と「1 世帯あたり」の違いが見えてくる。 これらの図表は本用語集の各記事 (相関、 散布図、 箱ひげ図、 ヒストグラム、 都道府県データ、 SSDSE など) で深掘りされている。
図表は単体で意味を持つわけではなく、 必ず「何を見せたいか」「読み手に何を伝えたいか」を意識して選ぶ必要がある。 単変量分布ならヒストグラムか箱ひげ、 2 変数の関係なら散布図、 群比較なら箱ひげかバイオリン、 時系列なら折れ線、 行列の構造ならヒートマップ、 のように対応関係を覚えておくと選択に迷わない。 本用語集の「可視化」カテゴリ約 30 記事は、 こうした図表選択のリファレンスとして横断的に活用できる。
SSDSE-B-2026 を題材にすると、 同じデータで複数の図を比べる練習ができる。 たとえば総人口 1 列を取り出して、 (1) ヒストグラム (2) 箱ひげ図 (3) バイオリンプロット (4) カーネル密度推定 (5) Q-Q プロットの 5 通りで描き比べると、 各図の長所短所が体得できる。 また、 総人口と消費支出の 2 列を使って、 (a) 散布図 (b) 対数軸散布図 (c) 残差プロット (d) Bland-Altman プロット (e) ヒートマップ風二次元密度図 の 5 通りで描き比べることで、 2 変量可視化の引き出しが揃う。
用語の名前が分からなくても、「データで何をしたいか」は言えることが多いものです。下の表は、分析でよく出てくる 14 の目的ごとに、最初に読むページ(入口)と、その次に読むとよいページ(次の一歩)を並べたものです。入口のページで基本の計算を SSDSE-B-2026 で動かしてから、次の一歩に進むと、同じデータで比べながら理解を広げられます。
| やりたいこと | 入口 | 次の一歩 | 最初に確かめること |
|---|---|---|---|
| 1 つの列の分布の形を知りたい | ヒストグラム・箱ひげ図 | カーネル密度推定・対数変換 | 東京都のような大きな値が図から落ちていないか |
| 「ふつうの県」を 1 つの数で言いたい | 平均・中央値 | ロバスト統計・MAD | 平均と中央値の差(総人口では 265 万人と 155 万人) |
| 2 つの列の関係を見たい | 散布図・相関 | Spearman 順位相関・見せかけの相関 | 件数どうしの相関は「人口の大きさ」を見ているだけではないか |
| 2 つのグループの差を確かめたい | t 検定・効果量 | ノンパラメトリック検定・検出力分析 | 564 行(12 年度分)のまま検定していないか |
| 3 つ以上のグループを比べたい | 分散分析 | Kruskal-Wallis 検定・多重比較 | 地方ごとの県の数(四国 4 県・関東 7 県など)の違い |
| ある値を他の値から予測したい | 単回帰・重回帰 | 正則化・交差検証 | 説明変数の桁の違い(人数と率)と多重共線性 |
| 県をいくつかのタイプに分けたい | k-means 法・階層クラスタリング | 混合ガウス・DBSCAN | 標準化したか、件数の列ばかりになっていないか |
| たくさんの列を少ない軸にまとめたい | 主成分分析 | Isomap・UMAP・t-SNE | 第 1 軸が「人口の大きさ」だけになっていないか |
| 年度による変化を追いたい | 時系列・折れ線グラフ | パネルデータ・固定効果 | CSV が新しい年度から並んでいること(並べ替えてから使う) |
| 原因と結果を見極めたい | 因果関係・交絡 | 差の差分析・操作変数法 | 「高齢化率」のような第 3 の変数が両方に効いていないか |
| 複数の表をつなぎたい | データ統合・内部結合 | 外部結合・主キー | 結合の前後で行数と合計が変わっていないか |
| 外れ値を見つけて扱いたい | 外れ値・箱ひげ図 | 外れ値の処理・ロバスト統計 | 「外れ値」がデータの誤りか、本物の大きな値(東京都)か |
| 欠けた値を扱いたい | 欠損値 | 欠損メカニズム・データクレンジング | その空欄が「0」なのか「不明」なのか |
| 分析結果を人に伝えたい | データ可視化・データストーリーテリング | 誤解を招くグラフ・著作権 | 軸の始点・出典の表示・加工したことの明記 |
表の右端の「最初に確かめること」は、各ページの落とし穴の節で実データを使って確かめている点です。たとえば「件数どうしの相関」は、総人口・死亡数・婚姻件数・学校数のような列がどれも「県が大きいほど大きい」ため、相関が 0.9 を超えやすいことを指しています(Isomap のページでは、こうした 7 列の相関が平均 0.966 でした)。
表の使い方の例: 「合計特殊出生率は地方によって違うのか」を調べたいとします。これは「3 つ以上のグループを比べたい」に当たるので、入口は分散分析です。「最初に確かめること」に従って地方ごとの県の数を見ると、四国は 4 県、九州・沖縄は 8 県と差があり、沖縄県(1.60)のように 1 県だけ大きく離れた値もあります。そこで次の一歩のKruskal-Wallis 検定(順位で比べるので外れた 1 県に引っ張られにくい)も並べて結果を比べ、差があるなら多重比較でどの地方の間かを調べる、という順に進みます。このように、表の 1 行が「どのページを、どの順で、何に気をつけて読むか」の道案内になっています。
分析をしていると、「数字は出たけれど、どこかおかしい」と感じる場面があります。そうしたときに疑うべきことと、原因を確かめられるページを、よくある 15 の症状ごとにまとめました。どの症状も、SSDSE-B-2026 でそのまま再現できる形で各ページに実例があります。
| 症状 | まず疑うこと | 読むページ |
|---|---|---|
| どの検定も p 値がとても小さくなる | 47 都道府県 × 12 年度の 564 行をそのまま使い、同じ県を 12 回数えている | パネルデータ・横断面データ |
| 相関はとても強いのに、話として意味が通らない | 2 つの列がどちらも人口の大きさに比例している | 見せかけの相関・交絡 |
| 回帰係数の符号が直感と逆になる | 説明変数どうしの相関が強い | 多重共線性・VIF |
| 重回帰の係数がほとんど 0 に潰れる | 人数(数百万)と率(0〜1)のように桁の違う列をそのまま入れている | 標準化・標準化偏回帰係数 |
| 訓練データでは完璧、新しいデータでは外れる | モデルが複雑すぎる、または評価に使う県が学習に混ざっている | 過学習・データリーケージ |
| 交差検証で R² がマイナスになる | 県コード順に並んだまま、並べ替えずに分割している | 交差検証・訓練・テスト分割 |
| 「最新年度」を取ったつもりが 2012 年度だった | CSV は新しい年度が先に並ぶので、last() や tail() が古い年度を返す | SSDSE・groupby |
| 表を結合したら行数や合計が増えた | 結合キーに重複がある(年度を落とした、など) | データ統合・データ結合 |
| 平均が思ったより大きい | 東京都のような大きな値に引っ張られている、または欠損が黙って除かれている | 外れ値・欠損値 |
| 割合の順位と件数の順位がまるで違う | 分母(総人口・世帯・子ども人口)の選び方で順位が入れ替わる | 高齢化率・集計 |
| 2015・2020 年度だけ値が段差のように動く | 国勢調査の年で、年齢不詳などの扱いが他の年度と違う | データ統合・測定誤差 |
| ヒストグラムから東京都が消えている | ビンの範囲を手で決めて、範囲の外の値が黙って落ちている | ヒストグラム・外れ値 |
| 年度の折れ線が、減っているはずなのに増えて見える | 年度で並べ替えずに描いた(CSV は 2023 → 2012 の順)、または年度のラベルを逆に振った | 折れ線グラフ・時系列 |
| 標準化したのに、外れ値が目立ったまま | 標準化は位置と目盛りを変えるだけで、分布の形(右裾)は変わらない | 標準化・対数変換 |
| グラフを見せたら違う結論で受け取られた | 縦軸の始点・2 つの軸の範囲・期間の切り取り | 誤解を招くグラフ・複合グラフ |
症状から原因へたどるときのコツは、「数字が変だ」と感じた時点で、①行数(何行を使ったか)、②分母(何で割ったか)、③年度(いつのデータか)、④単位(人・千人・%)の 4 つを先に確かめることです。上の 15 の症状のうち 9 つは、この 4 つのどれかで説明がつきます。残りの 6 つ(多重共線性・過学習・交差検証の分け方・ビンの範囲・標準化の限界・グラフの描き方)は、手法そのものの性質を知っていないと気づけない種類のつまずきで、対応するページの「落とし穴」の節を先に読んでおくと防げます。
このサイトの用語ページは、ほとんどが SSDSE-B-2026(47 都道府県 × 2012〜2023 年度の 564 行、年度・地域コード・都道府県名を含む 112 列)を例に使っています。手元の列から「この列で何を練習できるか」を探すための表です。列の分け方は、CSV の列コードの頭文字(A = 人口・世帯、B = 自然環境、C = 経済基盤、E = 教育、F = 労働、G = 文化・スポーツ、H = 居住、I = 健康・医療、J = 福祉・社会保障、L = 家計)に沿っています。
| 列のグループ(例) | データの性質 | 練習に向く用語 |
|---|---|---|
| A1101 総人口、A1301〜A1303 年齢 3 区分 | 強い右裾(東京都 1,409 万人・鳥取県 54 万人)。国勢調査の年は年齢不詳のため 3 区分の合計が総人口に届かない | ヒストグラム・対数変換・高齢化率 |
| A4101 出生数、A4103 合計特殊出生率、A4200 死亡数 | 件数と率が並んでいる。件数は人口の大きさに比例する | 合計特殊出生率・見せかけの相関 |
| A5101 転入者数、A5102 転出者数 | 差をとると転入超過(正負が両方ある量)になる | ラグ変数・時系列 |
| B4101 年平均気温、B4102・B4103 最高・最低気温 | 摂氏の気温は間隔尺度(比に意味が無い)。最低気温は負の値もとる | 間隔尺度・尺度水準 |
| E2101 小学校数など学校の列 | 学校数・教員数・児童生徒数の組で「1 校あたり」「教員 1 人あたり」を作れる | 特徴量エンジニアリング・比例尺度 |
| F3102 月間有効求職者数、F3103 月間有効求人数 | 2 列の比が有効求人倍率。2020 年度に全国で 1.467 → 1.056 と大きく下がる | 有効求人倍率・パネルデータ |
| H1800〜H1803 着工新設住宅 | 内訳 3 列の合計は総数に 0.5〜0.9% 届かない(給与住宅の列が無い) | データ統合・データクレンジング |
| J250502 保育所等利用待機児童数 | 0 の県が多い(2023 年度は 15 県)。0 と欠損の区別が大事 | 欠損値・外部結合 |
| L3221 消費支出と L322101〜L322110 の費目 | 二人以上の世帯の 1 世帯・月平均。人口の大きさとはあまり連動しない(2023 年度の総人口との相関 r = 0.33) | 複合グラフ・コサイン類似度 |
| 年度(SSDSE-B-2026 列)と地域コード(Code) | 年度は間隔尺度、地域コードは名義尺度。CSV は新しい年度が先に並ぶ | 名義尺度・横断面データ |
同じ列を複数の用語ページで使い回すと、「用語が変わると同じデータのどこを見るかが変わる」ことが分かります。たとえば総人口 1 列だけでも、ヒストグラムでは分布の形、対数変換では右裾の扱い、カーネル密度推定ではバンド幅の選び方、外れ値のページでは東京都の扱い、と見どころが変わります。1 つの列を決めて、関係するページを順に読んでいくのも効果的な使い方です。
各用語ページの末尾には「前提・並列・発展」の関連用語があります。それをたどると、次のような読み順が自然にできます。どれも、前のページの結果が次のページの出発点になるように並んでいます。
用語集を引く理由でいちばん多いのは、「似た言葉のどちらを使えばよいか分からない」ことです。取り違えると結論が変わってしまう 12 組を、1 行の違いと SSDSE-B-2026 での例で並べました。詳しくはそれぞれのページで、実データの計算で確かめられます。
| 用語の組 | 1 行で言う違い | SSDSE-B-2026 での例 |
|---|---|---|
| 標準偏差 / 標準誤差 | データのばらつき / 平均などの推定値のばらつき | 47 県の総人口の標準偏差は約 280 万人。平均の標準誤差はそれを √47 で割った約 41 万人 |
| 相関 / 回帰 | 関係の強さ(対称) / 一方から他方を予測する式(向きがある) | 高齢化率と人口千人あたり死亡数の相関は 0.97。回帰にすると「高齢化率 1 ポイントで死亡率がいくつ上がるか」になる |
| p 値 / 有意水準 | データから計算する値 / 分析の前に決めておく基準 | 基準 0.05 を先に決めずに p 値を見てから線を引くと、結論を後から選べてしまう |
| 第 1 種の過誤 / 第 2 種の過誤 | 差が無いのに「ある」と言う / 差があるのに見逃す | 47 県しか無いと検出力が低く、第 2 種の過誤が起きやすい |
| 適合率 / 再現率 | 「陽性と判定したもの」のうち正解の割合 / 「本当の陽性」のうち捕まえた割合 | 閾値を上げると適合率が上がり再現率が下がる(分類のページの閾値の表) |
| 母集団 / 標本 | 知りたい対象の全体 / 実際に手に入れた一部 | 47 都道府県はそれ自体が全体(全数)なので、「標本から母集団を推測する」枠組みをそのまま当てはめてよいかを考える必要がある |
| 間隔尺度 / 比例尺度 | 差にだけ意味がある / 比にも意味がある(0 が「無い」) | 気温 23.8℃ ÷ 11.0℃ = 2.16 倍は無意味、総人口の比は意味がある |
| 標準化 / 対数変換 | 位置と尺度をそろえる(形は変わらない) / 右裾を縮める(形が変わる) | 総人口を標準化しても東京都は +4 以上の外れ値のまま。対数にすると他県との差が縮む |
| 過学習 / 汎化 | 学習データに合わせすぎた状態 / 新しいデータでも当たる性質 | 47 県に高次の多項式を当てると訓練誤差は下がるが交差検証の誤差は上がる |
| 検証データ / テストデータ | モデルやハイパーパラメータを選ぶため / 最後に 1 回だけ性能を測るため | 検証データで選んだモデルの検証スコアは楽観的になる |
| 固定効果 / 変量効果 | 県ごとの違いを県ごとの定数で吸収 / 県ごとの違いを確率的なばらつきとみなす | 12 年度 × 47 県のパネルで、県の違いを説明変数と相関するものと見るかどうか(Hausman 検定) |
| 内部結合 / 外部結合 | 両方にある行だけ残す / 片方にしか無い行も残す(欠けは NaN) | 待機児童のいる 32 県の表を 47 県に外部結合すると 15 県が NaN になる |
用語はばらばらに覚えるより、1 つの問いに順番に当ててみると、それぞれの役割がはっきりします。「高齢化が進んだ県は何が違うのか」という問いに、6 つの用語ページの道具を順に使うと、次のように見え方が深まっていきます(数値は 2023 年度の 47 都道府県、65 歳以上人口 ÷ 総人口で計算)。
このように、同じ列(65 歳以上人口と総人口)からでも、用語が変わるたびに新しい問いが生まれます。気になった段階の用語ページを開き、そこにあるコードで数値を確かめながら読み進めると、用語どうしのつながりが実感を伴って身につきます。
各用語ページは同じ 15 章の順に並んでいるので、使える時間に合わせて読む章を選べます。
| 使える時間 | 読む章 | 身につくこと |
|---|---|---|
| 5 分 | 💡 30 秒で分かる結論 → 🎨 直感で掴む → ⚠️ 落とし穴 | 用語の意味と、使うときに最も間違えやすい点 |
| 30 分 | 上に加えて 📐 数式 → 🔬 読み解き → 🧮 手計算(Step ごとの数値) | 数式が何を計算しているかを、47 都道府県の数値で追える |
| 2 時間 | 上に加えて 🐍 Python 実装を「▶ ブラウザで実行」で動かし、列や年度を変えて試す → 🔗 関連用語へ | 自分のデータで同じ分析を組み立て、結果を読み、隣の手法と比べられる |
コードを動かすときは、まず書かれたとおりに実行して 📤 の出力と一致するかを確かめ、それから 1 か所だけ(年度・列・パラメータのどれか)を変えて、💬 の読み方がどう変わるかを見るのがおすすめです。変えた結果が 💬 の説明と食い違ったら、その食い違いこそが理解を深める入口になります。
カテゴリ別索引の件数が多くてどこから読めばよいか迷うときは、分野ごとに下の 3 ページから始めてください。3 ページとも、あとのページが前のページの内容を使う順に並べています。
| 分野 | 最初の 3 ページ(この順に) | 3 ページで分かること |
|---|---|---|
| 記述統計 | 平均 → 分散 → 四分位範囲 | 中心とばらつきを、外れ値に強い指標まで含めて 1 つの列で言える |
| 可視化 | ヒストグラム → 散布図 → 誤解を招くグラフ | 1 列・2 列の基本の図と、見る人を誤らせない描き方 |
| 確率と分布 | 確率 → 確率変数 → 正規分布 | 「ばらつきを確率で表す」考え方と、最もよく使う分布 |
| 推測統計 | 標本抽出と中心極限定理 → 信頼区間 → 仮説検定 | 手元のデータから、見えていない全体について幅つきで述べる方法 |
| 回帰 | 単回帰 → 決定係数 → 残差 | 直線を当てる・当てはまりを測る・外れ方を読む |
| 機械学習 | 教師あり学習 → 訓練・テスト分割 → 過学習 | 「当てはまり」と「予測できること」の違い |
| 教師なし学習 | 距離 → k-means 法 → 主成分分析 | 似ている・似ていないを数で測り、まとめる・縮める |
| 因果推論 | 因果関係 → 交絡 → 差の差分析 | 相関から因果へ進むために、何を比べればよいか |
| データの扱い | CSV → 欠損値 → データ統合 | ファイルを読み、欠けを扱い、表をつなぐ |
| AI と社会 | AI 倫理 → 公平性 → プライバシー | 分析や AI の結果が人に与える影響をどう点検するか |
pd.read_csv('data/raw/SSDSE-B-2026.csv', ...) と書かれたコードがそのまま通ります。1 ページの中では前のブロックの変数が引き継がれるので、上から順に実行してください。ブラウザで動かせないライブラリを使うブロックには、実行ボタンの代わりにその理由が書いてあります。用語ページのコードを書き換えて試すと、「この値で合っているのか」が気になることがあります。多くのページで繰り返し出てくる 2023 年度の値を、SSDSE-B-2026 から計算して並べました。自分の出力がこの表と大きく違うときは、年度の絞り込み(564 行のままになっていないか)、列の取り違え、単位(人・千人・万人)をまず確かめてください。
| 指標(2023 年度) | 全国 | 47 都道府県の中央値 | 最大 | 最小 |
|---|---|---|---|---|
| 総人口(A1101) | 124,353,000 人(47 県の合計) | 1,549,000 人 | 東京都 14,086,000 人 | 鳥取県 537,000 人 |
| 高齢化率(A1303 ÷ A1101) | 29.1%(合計どうしの比) | 31.8% | 秋田県 39.1% | 東京都 22.8% |
| 合計特殊出生率(A4103) | — | 1.30 | 沖縄県 1.60 | 東京都 0.99 |
| 出生数・死亡数(A4101・A4200) | 727,269 人・1,575,084 人 | — | — | — |
| 年平均気温(B4101) | — | 17.4℃ | 沖縄県 23.8℃ | 北海道 11.0℃ |
| 有効求人倍率(F3103 ÷ F3102) | 1.296(合計どうしの比) | 1.347 | 福井県 1.863 | 神奈川県 0.897 |
| 消費支出(L3221、二人以上の世帯・月平均) | — | 300,652 円 | 埼玉県 344,092 円 | 愛媛県 223,423 円 |
| 保育所等利用待機児童数(J250502) | 2,680 人(47 県の合計) | — | — | 0 人の県が 15 |
表の読み方の注意: 「全国」の列は、47 都道府県の分子と分母をそれぞれ合計してから割った値です(高齢化率なら 65 歳以上人口の合計 ÷ 総人口の合計)。47 県の率をそのまま平均した値とは違い、人口の多い都府県の値に引っ張られます。高齢化率では全国 29.1% に対して県の中央値は 31.8%、有効求人倍率では全国 1.296 に対して中央値 1.347 と、どちらも全国の値のほうが低めです。人口の多い都府県ほど高齢化率・倍率が低い傾向があるためで、どちらの「平均」を使ったかは、図や表に必ず書き添えます。合計特殊出生率や消費支出のように、県の中で計算済みの率・平均として収録されている列は、分子と分母が CSV に無いので、全国の値をこの表のように合計から作り直すことはできません。
用語ページの Python コードには、同じ順番で 4 つの記号が付いています。記号の意味を知っておくと、コードを読まずに何をしているかをつかめます。
| 記号 | 意味 | 読むときのポイント |
|---|---|---|
| 🎯 このコードでやること | コードが何を計算するかの 1〜3 行の説明 | 対象の年度・県の数・列がここに書いてある。コードがその通りに絞り込んでいるかを見る |
| 📥 入力例 | コードが読むデータの形(列名・行数・数行の実例) | 自分で書き換えるときは、この形のデータを渡せば動く |
| 📤 実行例 | 実際にコードを動かしたときの出力 | 「▶ ブラウザで実行」の結果と比べる。違えば年度や行数を確かめる |
| 💬 読み方 | 出力の数値が何を意味するかの解説 | 数値の大小だけでなく、「だから何が言えて、何が言えないか」が書いてある |
手計算の節では「Step 1、Step 2 …」の表で数式に実際の値を入れて計算し、そのすぐ後の Python で同じ値が出ることを確かめています。Step の表を自分で電卓を使って追い、Python の出力と一致するのを見ると、数式の各記号が何を指しているかが確実に分かります。
どの課題も、答えの数値はこの早見表か各ページの 📤 にあります。答えが合ったら、年度を 2012 年度に変えて同じ計算をし、11 年間で何が変わったかを確かめてみてください。
2012 年度の答え合わせ用の値: 総人口の合計 127,589,000 人(2023 年度より 323.6 万人多い)、全国の高齢化率 24.1%(県の中央値 26.0%)、全国の有効求人倍率 0.708(1.0 を下回る県が 45)、待機児童数の合計 24,825 人(0 人の県は 11)、出生数 1,037,165 人・死亡数 1,254,854 人、合計特殊出生率の県の中央値 1.44。11 年で出生数は約 3 割減り、死亡数は約 25% 増え、待機児童は 10 分の 1 近くまで減りました。ただし待機児童数や保育所の列には、2023 年度に集計の範囲が変わったとみられる段差があると指摘しているページ(データ駆動型社会・ビッグデータ)もあるので、長い期間の比較では各ページの注意書きも合わせて読んでください。
以下は本用語集の活用法を 170 観点に分けて整理したものである。 各観点は 200-300 字程度の独立解説で、 興味のある番号から拾い読みできる。 各観点の本文の後ろには「補足コメント」を 1 段落付け、 自学自習・業務応用・資格対策・倫理配慮など多面的な使い方が分かるようにしている。
本サイトは「ジャストインタイム型データサイエンス教育」の実装で、 必要なときに必要な用語を 5-30 分で深掘り把握できることを目標としている。 各記事は単なる定義集ではなく、 数式・実値計算・Python 実装・落とし穴・関連用語の 5 段階で「使える知識」へ変換する。 全 514 記事が相関基準 (約 60KB / 30,000 字以上、 図 3 表 6 コード 4) で統一されており、 学習者は記事を読み比べて自分に最適な深さを選べる。 章の順序は基本的に「上位概念→個別事例→Python 実装→演習」に統一されている。
補足: 本観点は SSDSE-B-2026 (47 都道府県・約 100 列) を実例として活用するときに具体的な手がかりとなる。 たとえば総人口列と消費支出列の組合せ、 高齢化率と保健医療費(二人以上の世帯)の関係、 月間有効求人数と求職者数から作る有効求人倍率など、 同じ生データから本観点に対応する切り口で図表を作って Python ノートブックに残しておくと、 後日他用語の学習でもそのまま再利用できる。 学習者は SSDSE のシートを 1 枚 Colab に常駐させ、 本観点 → 該当用語ページ → ノートブックの順で行き来する習慣を作ることが推奨される。
カテゴリは記述統計・確率分布・推定検定・回帰・機械学習・深層学習・NLP・コンピュータビジョン・可視化・AI 倫理・データ管理・統計教育・PPDAC・実験計画法・社会学的観点など。 全体を 1 枚にまとめた「概念マップ」が用意されており、 ノードをクリックすると個別記事に飛べる。 用語の親子関係・並列関係・対立関係が一目で理解できる構造を意識している。 また、 各記事末尾には「前提・並列・発展」の 3 区分で関連用語リンクを 15 件以上配置。
補足: 本観点は卒論・修論・業務報告・政策提言など、 学外のアウトプットを意識した学習者にとって特に重要である。 用語集を辞書として引くだけでなく、 「自分の文章にこの用語をどう埋め込むか」「査読者・読み手・上長が納得するためにどの数式・図表が必要か」を意識すると、 用語の使いこなしレベルが格段に上がる。 各記事の「落とし穴」セクションを併読し、 想定される反論を事前に潰しておくとアウトプット品質が安定する。
推奨は「記述統計 → 確率分布 → 推定検定 → 機械学習 → 深層学習」の順だが、 業務上の必要性に応じて自由に飛び込んでよい。 初学者は「ヒストグラム」「平均」「分散」「箱ひげ図」から、 中級者は「正規分布」「t 検定」「信頼区間」「p 値」から、 上級者は「ベイズ推定」「因果推論」「強化学習」「Transformer」から開始すると体系性が保てる。 各ステップで SSDSE-B-2026 を実例として使用することで、 抽象→具体の往復で理解が定着する。
補足: 本観点を踏まえると、 機械学習・統計の各種ツール (scikit-learn、 statsmodels、 PyMC、 lifelines など) の API ドキュメントを正確に読み解けるようになる。 用語集の定義 → 公式ドキュメント → ソースコード、 という三段ジャンプで「ブラックボックスを開ける」感覚が掴めると、 業務でモデル選定やパラメータ調整を任されたときの判断力が大きく変わる。 各記事の Python 実装サンプルは、 公式ドキュメントの該当ページにそのまま飛べる起点として設計されている。
用語集は問題解決サイクル PPDAC (Problem → Plan → Data → Analysis → Conclusion) の各段階で参照される。 Problem 段階では「研究設問」「仮説」「サンプリング」が、 Plan 段階では「実験計画法」「分散分析」「無作為化」が、 Data 段階では「データクレンジング」「欠損値処理」「外れ値検出」が、 Analysis 段階では「記述統計」「推測統計」「機械学習」が、 Conclusion 段階では「効果サイズ」「実用的有意性」「再現可能性」が中心となる。
補足: 本観点は AI ・データサイエンス領域の関連資格 (統計検定 1-3 級、 G 検定、 E 資格、 データサイエンティスト検定、 G7 系・国家試験) 対策にも直結する。 公式問題集を解く前後で関連用語ページを開き、 「30 秒結論」で要点を再確認、 「数式」「実値計算」で深掘り、 「落とし穴」で頻出引っかけポイントを潰す、 というルーチンを 3-5 周回すと安定して合格圏に入る。 各記事は資格学習だけでなく、 取得後の業務応用までを射程に入れて執筆されている。
全記事で Python 3.10+、 pandas 2.x、 scipy 1.11+、 sklearn 1.3+ を前提とする。 環境は Google Colab を推奨し、 import 文と `pd.read_csv('data/raw/SSDSE-B-2026.csv', encoding='cp932', skiprows=[1])` をコピペすればすぐ動く。 初心者向けに変数化を避け、 引数にパスを直書きする方針。 高度な機能 (numba, dask, polars) は応用記事のみで紹介。 全 514 記事で同一の Python スタイルを徹底することで、 学習者が「次に何をすべきか」迷わない。
補足: 本観点は AI ・データ活用の倫理・法務・社会的影響にも関わる。 個人情報保護法・GDPR・EU AI Act・各国 AI 推進法は急速に整備されつつあり、 統計用語・機械学習用語の選び方ひとつで対応が変わる場面もある。 本用語集は技術と社会の橋渡しを意識し、 各記事末尾で関連する倫理・社会記事へのリンクを配置している。 用語を単体で理解するのではなく、 社会的文脈の中に置いて理解する視点を養いたい。
本サイトは Python 中心だが、 統計分野では R のほうが充実したパッケージ (lme4, brms, ggplot2) もある。 t 検定や ANOVA は R の `aov()` / `t.test()` が標準で、 因果推論では `causaldata` / `did` が便利。 機械学習は Python (sklearn, PyTorch) が圧倒的。 経済学・社会学・生命科学では R 文化が根強い。 学習者は両方を使えるとキャリア選択肢が広がるため、 各記事末尾に R 相当コードを補記している記事もある。
古典統計は「真のモデル」を仮定し、 パラメータの推定誤差を厳密に議論する。 機械学習は「予測性能」を重視し、 真のモデルを問わず汎化誤差を最小化する。 両者は対立ではなく相補的で、 線形回帰は両方の語彙で解釈でき、 ベイズ推定は統計と機械学習の橋渡しとなる。 PRML、 ESL、 Bishop、 Murphy の教科書がこの統合をよく解説。 本用語集も「統計学的視点」「機械学習的視点」を併記する記事を多数用意している。
学術論文の用語と現場で使われる用語は微妙にズレることがある。 例: 「特徴量エンジニアリング」は機械学習用語、 「説明変数」は統計学用語、 「予測子」は経済学用語で、 中身はほぼ同じ。 本用語集は学術定義を主とし、 業界用語との対応関係をブラケットで併記する方針。 Kaggle・データ分析コンペでは現場用語が支配的で、 学術論文では学術用語が必須。 両方を知っておくと文脈に応じて柔軟に対応できる。
AI ・データ活用には倫理的配慮が不可欠。 GDPR・EU AI Act・日本の AI 推進法は法的枠組み、 fairness・透明性・説明可能性は倫理的原則。 アルゴリズムバイアスは学習データの偏りで生じ、 差別的予測を引き起こす危険がある。 本用語集は「AI 倫理」「公平性」「説明可能 AI」「データガバナンス」を独立カテゴリとして扱い、 技術と倫理を同等の重要性で配置している。
統計用語は論文の Methods セクションで頻出し、 用語の選び方が査読コメントを左右する。 例: 「significant」だけでなく「effect size = 0.5, 95% CI [0.3, 0.7]」と書く、 「correlation」と「causation」を区別する、 「p < 0.05」だけでなく「p = 0.034」と書く、 などが標準。 本用語集は各記事の冒頭で正式名称・略称・別名を整理し、 論文執筆時の引用元として活用できる。
用語の正式英訳を併記。 「相関係数 (correlation coefficient)」「分散分析 (analysis of variance, ANOVA)」「主成分分析 (principal component analysis, PCA)」など、 英文論文を読む際の対応関係を明示。 また、 米国・欧州・日本での用語の流行 (Big Data → AI → LLM の流れ) も併記し、 国際カンファレンスや学会で違和感なく議論に参加できる素地を作る。
独立行政法人統計センターが提供する教育用標準データセット (Standardized Statistical Data Set for Education) の最新版 (2026)。 47 都道府県を行に持ち、 「総人口」「男性人口」「女性人口」「高齢人口」「出生数」「消費支出」「合計特殊出生率」「年平均気温」「就業者数」「教育水準」など約 100 列を含む。 cp932 (Shift_JIS) エンコーディング、 1 行目はヘッダ、 2 行目は単位ラベル、 3 行目以降がデータ。 本用語集の全記事で共通実例として活用。
政府統計の総合窓口 e-Stat (https://www.e-stat.go.jp) から、 国勢調査・経済センサス・労働力調査・家計調査などのオリジナルデータを取得できる。 SSDSE は教育用に加工済みの一部だが、 e-Stat には数万のデータセットがある。 API 経由でプログラマブルに取得することも可能。 本用語集の中級・上級記事では e-Stat API を使った演習も用意している。
総務省統計局・厚生労働省・経済産業省・財務省などが発表する公式統計。 信頼性・代表性が高く、 学術論文・政策提言の根拠として広く使われる。 国勢調査は 5 年ごと、 労働力調査は毎月、 GDP 統計は四半期ごとと、 公表頻度が異なるため目的に応じて選ぶ。 本用語集は政府統計の読み方・活用法も「公的統計」「統計法」「個票データ」「ミクロデータ利用」の独立記事で解説。
高校情報科 (情報 I・II) ではデータ分析・統計が必修化され、 大学では文系学部でも統計入門が広がる。 本用語集は高校生から大学院生まで広い対象に向けて、 「30 秒結論」で全員に概略を、 「数式」「Python 実装」で専門学習者に深い理解を提供する設計。 高校教師は「Python 実装」セクションを Colab に貼って授業で使え、 大学教員は「数式」セクションを輪読会の教材にできる。
経済学部・心理学部・工学部・医学部・教育学部などで統計教育が標準化。 経済学部は計量経済 (パネルデータ・操作変数・差分の差分)、 心理学部は心理測定 (因子分析・SEM)、 医学部は疫学 (オッズ比・相対リスク・コホート研究)、 工学部は品質管理 (SPC・実験計画法)、 教育学部は教育測定 (項目反応理論・等化) と分野特化型の用語がある。 本用語集はこれらすべてを横断的に網羅。
情報 I では「データ分析の基礎」「散布図・相関」「箱ひげ図・ヒストグラム」が必修。 情報 II では「機械学習の基礎」「データサイエンス入門」が含まれる。 本用語集は高校情報科の単元配列に対応した検索・引用が可能。 教科書記述よりも深い数式・実装を提供することで、 探究学習・課題研究で活用できる。 各記事の「30 秒結論」「直感」は高校生にも親しみやすい記述。
社会人の学び直しでデータサイエンス・AI が最大の人気領域。 本用語集はリスキリング用の体系教材として、 「業務で使える知識」を意識した記事構成。 経営層・管理職向けに「30 秒結論」、 中堅エンジニア向けに「Python 実装」、 専門家向けに「数式」と「落とし穴」を提供。 経済産業省「デジタルスキル標準」とも整合し、 DX 人材育成のリファレンスとして活用できる。
AtCoder・Codeforces・LeetCode などの競プロでも統計・確率の基礎は問われる。 期待値・確率分布・組合せ論・最大尤度の用語は競プロ問題でしばしば登場。 本用語集は競プロ向けに「実装の高速化」「メモリ効率」「数値安定性」の TIPS も併記。 アルゴリズムと統計の交差点 (オンライン学習・乱択アルゴリズム) の記事は競プロ実装者にも有用。
世界最大のデータ分析コンペ Kaggle では、 特徴量エンジニアリング・モデルアンサンブル・クロスバリデーションの巧拙が勝敗を決める。 本用語集の「Kaggle」「XGBoost」「LightGBM」「CatBoost」「スタッキング」「ブレンディング」記事は実戦的な内容。 メダル獲得経験者の暗黙知を可能な限り言語化し、 公開ノートブックでは見えない落とし穴も整理。
プログラミング Q&A サイトで、 pandas・sklearn の使い方で詰まったら最初に検索する場所。 本用語集の Python 実装セクションは Stack Overflow で頻出する質問に対する「正しい答え」を提供する設計。 例えば「pandas DataFrame の groupby + agg」「sklearn の StratifiedKFold」「scipy の独立 t 検定」は各記事内で具体的に解説している。
オープンソースのコード共有プラットフォーム。 本用語集の Python コードはすべて再現可能で、 ライセンス的にも自由に利用できる (MIT 想定)。 学習者は GitHub に自分のノートブックを公開し、 ポートフォリオとして就活・転職に活用できる。 各記事の Python 実装をフォークして自分の探究学習に組み込むのも推奨。
scipy・pandas・sklearn・PyTorch・TensorFlow など本用語集が依拠するライブラリはすべてオープンソース。 これらのドキュメント・チュートリアル・ソースコードを直接読むことで、 用語の理解は飛躍的に深まる。 本用語集は公式ドキュメントへのリンクを各記事末尾に配置し、 一次情報へのナビゲーションも提供。
学術論文では査読 (peer review) を通過して初めて公表される。 統計手法の選択・実装・解釈は査読者から厳しくチェックされ、 「サンプルサイズが小さい」「正規性が不十分」「効果サイズが報告されていない」などのコメントがつく。 本用語集は査読を意識した記述で、 各記事の「落とし穴」セクションが査読対策にも役立つ。
Digital Object Identifier は学術成果物の永続的識別子。 本用語集の各記事は内部リンクを `#` または相対 URL で持ち、 将来 DOI を付与すれば学術引用に対応可能な設計。 引用形式は APA・MLA・Chicago など複数のスタイルがあり、 卒論・修論・学術論文で適切に選ぶ必要がある。 各記事は引用しやすいよう、 タイトル・著者・公開日を明示。
統計学会・人工知能学会・情報処理学会・行動計量学会・応用統計学会などが日本の主要学会。 国際学会では NeurIPS・ICML・KDD・JSM・WSC が中心。 本用語集は学会発表でよく使われる用語を網羅的に解説し、 学会聴講の予習にも活用できる。 学会参加経験のない学生は、 まず本用語集で基礎を固めることを推奨。
本用語集は自学自習の効率を最大化する設計。 「30 秒結論」で全体像を、 「直感」で動機を、 「数式」で厳密性を、 「実値計算」で具体性を、 「Python 実装」で実行可能性を、 「落とし穴」で応用力を、 「関連用語」で次のステップを提供。 1 記事 30 分で 1 用語を完全に習得できる構成。
データサイエンス学習はメンター (先輩・教員・社会人) との対話で大きく加速する。 本用語集はメンタリングの教材としても活用でき、 「この記事を一緒に読もう」と提案するだけで深い議論が始まる。 メンターは「Python 実装」を一緒にデバッグし、 メンティーは「落とし穴」セクションで実践的な疑問を解消できる。
短期集中型のデータサイエンス研修。 数週間で機械学習エンジニアを養成するプログラムが流行。 本用語集はブートキャンプの自習補助教材として、 講義で扱われない深さの内容を提供する。 各記事 30 分 × 514 記事で約 250 時間、 ブートキャンプの 2-3 ヶ月分の学習量を網羅する密度。
「統計学入門」(東大出版) 、 「データ解析のための統計モデリング入門」(久保) 、 「PRML」(Bishop) 、 「ESL」(Hastie) 、 「Murphy 機械学習」「ゼロから作る Deep Learning」(斎藤) は定番。 本用語集は専門書を読む前の予習・読書中の用語確認に最適。 各記事末尾の「参考文献」セクションで対応する書籍を明示。
Coursera・edX・Udemy・DataCamp は世界中の大学・企業がコースを提供。 Andrew Ng の機械学習コース、 deeplearning.ai の Deep Learning Specialization は定番。 本用語集はオンライン講座の補助教材として、 講義で「サラッと触れただけ」の用語を深掘りできる。 受講中に分からない用語が出たら、 本サイトで検索 → 30 分で習得 → 講義に戻る、 が王道。
YouTube には 3Blue1Brown・StatQuest・Two Minute Papers など優れた教育チャンネルがある。 本用語集は動画教材の文字版として、 動画では追いきれない数式・コードの詳細を補完。 動画 → 本サイトの「数式」セクション → Python 実装、 の流れで理解が深まる。 動画と文字情報のハイブリッド学習が現代の最適解。
Data Skeptic、 Linear Digressions、 Lex Fridman などのポッドキャストでデータサイエンスの最新動向を耳学習。 通勤・運動中に概略を掴み、 本用語集で詳細を確認する流れが効率的。 ポッドキャストで出てきた用語を本サイトで検索する習慣をつけると知識ネットワークが急速に拡張する。
他の用語集・Wikipedia と異なる本サイトの特徴: (1) 全 514 記事が相関基準で統一されている、 (2) SSDSE-B-2026 を全記事で実例として使用、 (3) Python 実装が動作確認済みで Colab で即実行可能、 (4) 落とし穴セクションで実務的な注意点を網羅、 (5) 関連用語が 15 件以上で知識ネットワーク化、 (6) 概念マップで全体構造が可視化。
47 都道府県データを使った典型的な分析例: (a) 総人口と消費支出の散布図 + 相関 (2023 年度 r=0.33。 消費支出は 1 世帯あたりの値なので人口規模とは弱くしか連動しない)、 (b) 都道府県別人口のヒストグラム (右に裾が長い分布、 東京が外れ値)、 (c) 地方別の高齢化率の箱ひげ図、 (d) 高齢化率と保健医療費(二人以上の世帯)の回帰分析、 (e) 有効求人倍率を高齢化率と総人口で説明する重回帰、 (f) 主成分分析で 47 都道府県を 2 次元可視化。 これらは複数の記事で並列に扱う。
本用語集の図は (1) 散布図 (2 変数の関係) 、 (2) ヒストグラム (1 変数分布) 、 (3) 箱ひげ図 (群別比較) 、 (4) 折れ線 (時系列) 、 (5) 棒グラフ (カテゴリ別大小) 、 (6) ヒートマップ (相関行列) の 6 種類が中心。 すべて matplotlib + seaborn で生成し、 PNG 形式で `figures/` に格納。 学習者は同じ図を自分でも再現できる。
本用語集の表は (1) 用語の対比表 (用語 A vs 用語 B)、 (2) サンプルデータ表、 (3) 計算過程の中間結果、 (4) ハイパーパラメータ一覧、 (5) 性能評価 (accuracy, precision, recall, F1)、 (6) よくある誤解の修正表、 が頻出。 すべて HTML `
| カテゴリ | 件数 |
|---|---|
| 統計 | 120 |
| 機械学習 | 180 |
| AI 倫理 | 50 |
| データ基盤 | 80 |
| 可視化 | 50 |
| その他 | 34 |
1 2 3 4 5 | import numpy as np counts = np.array([120, 180, 50, 80, 50, 34]) ratio = counts / counts.sum() print(f"合計: {counts.sum()}") print(f"比率: {ratio.round(3)}") |
💬 手計算 (Step 2) 514 件 / 35% と Python 出力が完全一致。
「用語集トップ」を実際の課題に当てはめるとき、 状況別に何を選ぶかを 3 段階で判定する。
このフローは状況依存。 上記は出発点として参照し、 領域知識で調整する。
「用語集トップ」は単独で完結する手法ではなく、 隣接領域と連携することで真価を発揮する。
これらの接続を意識することで、 「用語集トップ」を中核に据えた一貫した分析パイプラインを構築できる。
用語ページ間の「関連用語」リンク 1,345 本をネットワークとして可視化しました。色はグラフ構造から自動検出した12分野。クリックで用語の詳細、ダブルクリックでページに移動できます。検索・分野絞り込みは 全画面版 → が便利です。