本ページは AIコア技術(AIの中核技術)(Core AI Technologies)を 14 のセクションで多角的に解説します。 上のチップは検索・関連語の手がかりです。 以下のリンクで各セクションに直接ジャンプできます:
🍰 まずはやさしく
AIを動かすための心臓のような技術です。
機械に人間のような知能を持たせるために使います。
スマホの予測変換などの仕組みに使われています。
AIを支える代表的な技術について読みましょう。
AIコア技術(Core AI Technologies):AI(人工知能)を実現する中核技術群 — 機械学習・深層学習・最適化・表現学習・自然言語処理・強化学習など
sklearn.linear_model.LinearRegression や sklearn.cluster.KMeans が「AI 基礎の最短ハンズオン」。 SSDSE-B-2026 を pandas で読み込み、 fit/predict を 3 行で体験できる。🍰 まずはやさしく
AIという大きな傘の中にある具体的な道具です。
計算を実際に行い、答えを出すために使います。
部活の成績から勝ち負けを予想するような仕組みです。
どの技術がどんな役割を持つのかを整理しましょう。
AIコア技術は AI(人工知能)を実際に動かしている中核技術群の総称。 AI が「知的振る舞いを機械で実現する研究分野」という大傘語であるのに対し、 AIコア技術はその内側で計算を担う 機械学習・深層学習・最適化・表現学習・自然言語処理・強化学習・知識表現という技術層を指す。 統計検定や G 検定では「AI ⊃ ML ⊃ DL」の階層関係と、 各コア技術がどのタスク(分類・回帰・生成・制御)に対応するかを初手で問われることが多く、 整理しておくのが必須。
🍰 まずはやさしく
人間の考え方を機械で再現する仕組みのことです。
データから自動でルールを見つけるために使います。
ネットショップのおすすめ商品が出る仕組みです。
AIがどうやって学習して動くのかを考えましょう。
「AI とは何か」 を考えるとき、 厳密な定義より「人間の知的活動を機械が代行する仕組み」と理解するのが入門には十分です。 AIコア技術は、 その仕組みを実際に計算として動かす技術層(機械学習・深層学習・最適化・表現学習など)として位置づけてください。
本ページの AIコア技術は 「機械学習を中核とする現代 AI の技術層」 を指す。 記号 AI (Symbolic AI)・古典的エキスパートシステムとは異なり、 データから自動でパターンを抽出する 帰納的 アプローチ。 弱い AI (特化型) と強い AI (AGI) の区別、 統計学・最適化との隣接関係を抑えると後続の章が見通しよくなる。
AI と聞いて多くの人は ChatGPT や自動運転を想像するが、 学問領域としての AI は1956 年のダートマス会議に発する半世紀以上の伝統がある。 "知能とは何か" を定義する代わりに、 "知能的に見える振る舞いを機械が再現できるか" を経験的に検証してきた。 現在は ML(学習でルールを発見する)と DL(多層ニューラル) が事実上の中心技術となり、 これらを総称する見出し語が AI であり、 その内部で実際に働く技術層が本ページの主題 AIコア技術である。 つまり AI ⊃ ML ⊃ DL ⊃ 生成 AI の入れ子構造で位置づけると混乱しにくい。
🍰 まずはやさしく
AIを実現するための中心的な技術の集まりです。
分析や予測などの道具として幅広く使います。
地域の人口の変化を予測する計算などに使われます。
AIコア技術の正確な意味と種類について学びましょう。
AI(人工知能)を実現するための中核技術群 — 機械学習・深層学習・最適化・表現学習・自然言語処理・強化学習・知識表現など — の総称
英語名 Core AI Technologies。 同義・関連語:AIの中核技術, AI中核技術, AI基盤技術。
AI(人工知能)の一般形を数式 / 形式定義で表す(AIコア技術は、 この最適化を実際に解くための技術群):
意思決定エージェント形式での AI の一般化:状態 $s_t$ における行動 $a_t$ を、 効用 $U$ の期待値を最大化するように方策 $\pi$ を選ぶ。
分類タスクの標準損失。 「正解クラスの予測確率が 1 に近いほど損失が小さい」という構造。
💡 Attention の本質は 「全トークン間の関係性を計算する」こと。 RNN が逐次処理だったのに対し、 Attention は並列計算可能 → GPU 効率で LLM スケール革命を起こした。
| タスク | 指標 | 定義 | 特徴 |
|---|---|---|---|
| 分類 | Accuracy | (TP+TN)/全件 | 不均衡データに弱い |
| Precision/Recall | TP/(TP+FP), TP/(TP+FN) | トレードオフ | |
| F1 | 調和平均 (P, R) | バランス指標 | |
| AUC | ROC 下面積 | 閾値非依存 | |
| 回帰 | RMSE | $\sqrt{\sum(y-\hat{y})^2/N}$ | 外れ値に敏感 |
| MAE | $\sum|y-\hat{y}|/N$ | 外れ値耐性 | |
| R² | 1 - SSE/SST | 説明力 | |
| 生成 | BLEU, ROUGE, FID | 参考訳との一致度 | タスク固有 |
| 分野 | ライブラリ | 初版 | 主要用途 |
|---|---|---|---|
| 古典 ML | scikit-learn | 2007 | 汎用 ML、 教育 |
| XGBoost | 2014 | Kaggle、 業務 ML | |
| LightGBM | 2017 | 大規模、 高速 | |
| DL | PyTorch | 2016 | 研究、 LLM |
| TensorFlow | 2015 | production、 mobile | |
| JAX | 2018 | 研究、 大規模 | |
| LLM | HuggingFace Transformers | 2018 | 事前学習モデル |
| LangChain / LlamaIndex | 2022 | RAG、 エージェント |
AI コアを支える数式は意外と少ない。 5 つで 8 割。
SSDSE-B-2026 で実際に使うのは 1, 2 が中心。 3-5 は文脈理解として知っておく。
本ページの要点を 8 行で:
次は 機械学習、 深層学習、 AI ページへ進んでください。
| ライブラリ | 主用途 | SSDSE-B での使い所 |
|---|---|---|
| scikit-learn | 古典 ML | 線形・RF・GBDT |
| XGBoost / LightGBM | GBDT | 表形式予測のチャンピオン |
| PyTorch | DL | 大規模化時のみ |
| TensorFlow / Keras | DL | 同上 |
| HuggingFace Transformers | NLP DL | 都道府県紹介文生成 |
| SHAP | 解釈 | 特徴量寄与の可視化 |
| Optuna | ハイパラチューニング | GBDT のパラメータ探索 |
| MLflow | 実験管理 | 本番運用時 |
初学者はまず scikit-learn と XGBoost を完璧にこなせるようになることを目標にすること。 SSDSE-B-2026 でこの 2 つを使い切れれば、 表形式タスクの 9 割に対応できます。
SSDSE-B-2026 を題材に AI プロジェクトを 1 つ完了させるテンプレを示します。
| フェーズ | SSDSE-B での実装 | 使うライブラリ |
|---|---|---|
| 1 課題定義 | 「人口減少県の特徴抽出」 | — |
| 2 データ取得 | SSDSE-B-2026 ダウンロード | pandas |
| 3 EDA | 分布・相関行列 | pandas / seaborn |
| 4 ベースライン | 線形回帰 | scikit-learn |
| 5 改良モデル | XGBoost | XGBoost + Optuna |
| 6 解釈 | SHAP プロット | SHAP |
| 7 LLM 統合 | 都道府県紹介文生成 | OpenAI/Anthropic SDK |
| 8 レポート | 結論 + 政策提案 | matplotlib / Notion |
この 8 ステップを 3 回繰り返せば、 AI コア技術の実務感覚はおおむね身につきます。
| Q | A |
|---|---|
| 「AI と機械学習はどう違う?」 | AI が大きな概念で、 機械学習はその実装手法の 1 つ。 機械学習はデータからルールを学ぶ AI 技術。 |
| 「深層学習はいつ使う?」 | 大規模データ (n > 10000)、 非構造化データ (画像 / 音声 / テキスト) のとき。 SSDSE-B-2026 のような小規模表形式では使わない。 |
| 「XGBoost と LightGBM の違いは?」 | どちらも GBDT。 LightGBM は分割の枝伸ばし方が異なり、 大規模データで高速。 中小規模では両者ほぼ互角。 |
| 「LLM の学習を自分でやる必要は?」 | 普通は無い。 API 利用または事前学習モデルを fine-tune するのが現実解。 |
| 「強化学習は SSDSE-B で使える?」 | SSDSE-B は静的データで報酬構造がないので、 直接は使えない。 シミュレータを別途構築すれば可。 |
| 「データが小さいのに DL を使うとどうなる?」 | 典型的に過学習。 train R^2 が高くなり test R^2 が下がる。 n < 1000 なら古典 ML 推奨。 |
| 「説明可能 AI とは?」 | モデルの予測根拠を人間が理解できる形で示す技術。 SHAP, LIME, 部分依存図が代表的。 |
| 「AI と統計学の違いは?」 | 統計は推定と検定が主、 AI は予測と意思決定が主。 重なりも多い。 |
SSDSE-B-2026 (2023 年、 47 都道府県) の総人口・65 歳以上人口・婚姻件数の 3 特徴で出生数 (A4101) を予測する場合のベンチマーク (5-fold CV R^2、 実測):
| モデル | R^2 (5-fold CV) | 学習時間 | 解釈性 |
|---|---|---|---|
| 平均値 (ベースライン) | -1.73 | 瞬時 | 容易 |
| 線形回帰 | 0.94 | 瞬時 | 容易 |
| Ridge | 0.94 | 瞬時 | 容易 |
| Lasso | 0.94 | 瞬時 | 容易 |
| 決定木 (深さ 3) | 0.79 | 瞬時 | 容易 |
| RandomForest | 0.89 | 0.5 秒 | 中 |
| 勾配ブースティング (GBDT) | 0.90 | 1 秒 | 中 |
| MLP (NN) | 0.06 | 5 秒 | 低 |
SSDSE-B のような線形性の強い小規模データでは線形系が王者 (0.94)。 アンサンブル系 (GBDT 0.90 / RF 0.89) が僅差で続き、 標準化前提が崩れる MLP は大きく劣化する。 これが「No Free Lunch」 の現場感覚。
AI が社会に与える影響は技術以上にデータサイエンスの根幹に関わる。 SSDSE-B-2026 のような公的データを使う際の社会的責任を 5 つの観点で整理。
| 観点 | SSDSE-B での具体例 | 対処 |
|---|---|---|
| 偏り (Bias) | 東京・大阪に集中した分析結果 | 地方ブロック別評価 |
| 説明責任 | 予測の根拠を市民に説明 | SHAP プロット添付 |
| 透明性 | 使用データと手法を公開 | ノートブック GitHub 公開 |
| プライバシー | 小自治体での再特定リスク | k-匿名化 / 集計値のみ使用 |
| 反復改善 | 結果に対する市民からのフィードバック | 意見徴収プロセス整備 |
2026 年現在、 AI コア技術は LLM とエージェント (LLM が自律的にタスクを実行する仕組み) が中心になっています。 SSDSE-B-2026 のような表形式データすら、 LLM が「列の意味を解釈し → モデルを提案し → コードを書き → 結果を解釈する」 という流れで分析できるようになりました。 ただし、 数値の正確性・計算の信頼性は古典 ML が担うため、 ハイブリッド構成が標準。 また、 因果推論や説明可能 AI (XAI) が政策意思決定の現場で重要度を増しており、 SSDSE-B のような公的データを用いて、 「政策 X が実施された県と未実施の県で結果がどう違うか」 を因果的に評価する取り組みが進んでいます。 これら 「LLM × 因果推論 × XAI」 が今後の AI コア技術の三本柱になるでしょう。 学ぶ皆さんは、 1 つの手法に深く精通すると同時に、 全体地図を常に頭に入れておくことが重要です。 47 都道府県のデータを通じて、 自分の街・自分の県の物語を AI で読み解いてみてください。 きっと新しい発見と、 数字の向こうにある「人々の生活」 への眼差しが育つはずです。 この用語ページがその出発点となれば幸いです。
AI コア技術は単独で存在せず、 周辺の用語と複雑に絡み合います。 主要な 20 用語との関係を表にまとめます。
| 関連用語 | AI コアとの関係 | SSDSE-B での具体例 |
|---|---|---|
| 機械学習 | サブセット | 線形回帰で人口 → 出生数 予測 |
| 深層学習 | 機械学習の一部 | 大規模化時のみ採用 |
| 強化学習 | AI コアの 1 分野 | 政策選択のシミュレーション |
| 自然言語処理 | AI コアの 1 分野 | 都道府県紹介文生成 |
| コンピュータビジョン | AI コアの 1 分野 | 地図・衛星画像と組み合わせ |
| 知識表現 | AI コアの 1 分野 | 都道府県メタデータ統合 |
| 大規模言語モデル | NLP の最前線 | EDA 補助、 レポート生成 |
| 生成 AI | LLM などを含む | 政策提案文生成 |
| Attention | Transformer の核 | NLP 分野で利用 |
| Transformer | DL アーキテクチャ | NLP / CV で標準 |
| RAG | LLM + 検索 | SSDSE-B を外部知識として注入 |
| 因果推論 | 意思決定の根拠 | 政策効果評価 |
| 説明可能 AI | 解釈の枠組み | SHAP / LIME |
| 転移学習 | 事前学習モデルの再利用 | 少データタスクで有効 |
| fine-tuning | 事前学習の追加調整 | 都道府県別 fine-tune |
| 埋め込み (Embedding) | 表現学習 | 都道府県をベクトル化 |
| クラスタリング | 教師なし ML | 都道府県をグループ化 |
| 次元削減 | 表現の圧縮 | 多変量を PCA で 2 次元化 |
| 異常検知 | 外れ値発見 | 東京を異常と判定 (IsolationForest) |
| 時系列解析 | 過年度比較 | SSDSE-B 各年の推移 |
AI コア技術を深く学びたい人向けの主要な研究機関・教材リソース。 ここから自分のレベルに合うものを 1 つ選んで進めるとよいでしょう。
| レベル | 機関 / 教材 | 形態 |
|---|---|---|
| 入門 | Coursera Machine Learning (Andrew Ng) | 動画 + 演習 |
| 入門 | fast.ai Practical Deep Learning | 動画 + Jupyter |
| 中級 | scikit-learn 公式チュートリアル | ドキュメント |
| 中級 | Hugging Face Course | 動画 + Notebook |
| 中級 | StatQuest YouTube | 動画 |
| 上級 | Goodfellow et al. Deep Learning (本) | 書籍 |
| 上級 | Stanford CS224N NLP | 大学講義 |
| 上級 | UC Berkeley CS285 RL | 大学講義 |
| 研究 | NeurIPS / ICML / ACL | 論文 |
| 実務 | Kaggle | コンペ |
本ページの理解度を 10 問でチェック。 各問を SSDSE-B-2026 を題材に自分の言葉で説明できれば合格です。
「AI コア技術を学ぶとは、 数式・コード・データ・倫理・社会の 5 つを同時に育てること」 — これが本ページの結論です。 数式だけでもコードだけでも片手落ち。 SSDSE-B-2026 を素材にして、 47 都道府県という具体的な「人々の生活」 と向き合いながら、 5 つを並行して鍛えていきましょう。 焦らず、 楽しんで、 一歩ずつ。 1 年後、 あなたはきっと AI コア技術の実務的な担い手として、 自分の地域や組織に貢献できるはずです。 そして、 その貢献の核心は、 高度な手法より「データに対する誠実さ」 にあります。 47 都道府県のすべての数字の背後には、 1 億人を超える人々の暮らしがある。 そのことを忘れずに、 数字と向き合う。 これが本ページから皆さんへの最後のメッセージです。
AI コア技術はさらに細かいサブトピックに分かれます。 30 個ピックアップして、 SSDSE-B-2026 とのつながりを示します。
| # | サブトピック | 所属分野 | SSDSE-B での距離感 |
|---|---|---|---|
| 1 | 線形回帰 | ML | 主役 |
| 2 | ロジスティック回帰 | ML | 分類タスクで使用 |
| 3 | Ridge / Lasso | ML | 多重共線性対策 |
| 4 | Elastic Net | ML | L1 + L2 のハイブリッド |
| 5 | 決定木 | ML | 解釈用 |
| 6 | RandomForest | ML | ベースラインを超える時 |
| 7 | XGBoost | ML | 表形式のチャンピオン |
| 8 | LightGBM | ML | 大規模向け GBDT |
| 9 | CatBoost | ML | カテゴリ特徴量向け GBDT |
| 10 | SVM | ML | 小データで安定 |
| 11 | k-NN | ML | 距離ベース、 シンプル |
| 12 | ナイーブベイズ | ML | テキスト分類 |
| 13 | MLP (多層パーセプトロン) | DL | NN の基本 |
| 14 | CNN | DL/CV | SSDSE-B 単体では不要 |
| 15 | RNN / LSTM | DL/NLP | 時系列だが Transformer に置換 |
| 16 | Transformer | DL/NLP | NLP の標準 |
| 17 | BERT | DL/NLP | 双方向 Transformer |
| 18 | GPT | DL/NLP | 自己回帰型 Transformer |
| 19 | ResNet | DL/CV | 残差接続 |
| 20 | ViT | DL/CV | 画像 Transformer |
| 21 | YOLO | DL/CV | 物体検出 |
| 22 | Q-Learning | RL | 離散行動 RL |
| 23 | DQN | RL | NN + Q-Learning |
| 24 | PPO | RL | 連続行動 RL |
| 25 | k-means | ML | 都道府県クラスタリング |
| 26 | 階層クラスタリング | ML | 樹形図で表示 |
| 27 | PCA | ML | 多変量の次元削減 |
| 28 | t-SNE | ML | 非線形可視化 |
| 29 | UMAP | ML | t-SNE の高速版 |
| 30 | IsolationForest | ML | 異常検知 (東京を検出) |
AI コア技術を活かす職種は多岐にわたります。 主要 7 職種を整理。
| 職種 | 主要技術 | 典型年収レンジ (国内) |
|---|---|---|
| データアナリスト | SQL, BI, EDA | 500-800 万 |
| データサイエンティスト | ML, 統計, Python | 700-1500 万 |
| ML エンジニア | MLOps, Docker, K8s | 800-1800 万 |
| NLP エンジニア | Transformers, LLM | 900-2000 万 |
| CV エンジニア | CNN, ViT | 800-1800 万 |
| AI リサーチャー | 論文、 数理 | 1000-2500 万 |
| AI プロダクトマネージャー | 戦略、 UX | 900-2000 万 |
※ 数字は 2026 年時点の目安。 経験年数・組織規模・地域で大きく変動します。 SSDSE-B-2026 で素振りした人が一番入りやすいのはデータアナリストかデータサイエンティスト。 そこから派生して他職種へ移行するパターンが標準的です。
本ページの内容を 12 行で振り返り、 次に読むべきページを示します。
次は 機械学習、 深層学習、 大規模言語モデル、 生成 AI、 交差検証、 強化学習 へ進んでください。 それぞれが本ページで触れたサブトピックを詳細化しています。
本ページで紹介したコードを実際に動かすには、 SSDSE-B-2026 の CSV を data/raw/SSDSE-B-2026.csv に配置する必要があります。 入手元と前処理手順を整理します。
data/raw/ ディレクトリに配置。A1101 など)、 2 行目が日本語ラベル行なので、 skiprows=[1] で日本語ラベル行を飛ばし、 列コードをヘッダとして読み込む (本ページの全コードでこのオプションを使用)。cp932(Shift_JIS 系)を明示(本ページのコードはこれで統一)。 UTF-8 版が配布される場合もあるので、 手元のファイルに合わせて切り替える。str.replace('都','') 等で前処理。A1101 (総人口)、 A4101 (出生数)、 A9101 (婚姻件数) など、 アルファベット + 数字 4 桁のコード形式。 詳細は SSDSE-B-2026 のメタデータ表を参照。NaN で記録されることが多いが、 一部 0 の場合もあるので info() と isna().sum() で確認。2026 年現在、 日本の大学・高専で AI コア技術を学べる主要カリキュラムは以下のとおりです。 文部科学省の MDASH (数理・データサイエンス・AI 教育プログラム) 認定校が増えています。
| カリキュラム | 主目的 | 到達レベル |
|---|---|---|
| MDASH リテラシー | 全学生対象、 AI の基本理解 | 用語理解、 簡単な可視化 |
| MDASH 応用基礎 | 専門外学生向け実践 | scikit-learn で基本ML |
| MDASH エキスパート | 専門学生向け、 深い理解 | 研究レベルへの土台 |
| 滋賀大データサイエンス学部 | 4 年間体系学習 | 実務即戦力 |
| 横浜市大データサイエンス学部 | 同上 | 同上 |
| 立教大 AI 科学研究科 | 大学院レベル | 研究者育成 |
| 東京工業大 AI コア研究 | 研究中心 | 論文発表 |
SSDSE-B-2026 はこれらカリキュラムの実習教材として広く採用されています。 学習者は自分の所属するカリキュラムに合わせ、 本ページの内容を補講として使えるでしょう。
AI コア技術は広大ですが、 SSDSE-B-2026 を素材に「線形回帰 → RandomForest → XGBoost → SHAP → LLM 連携」 の 5 ステップを 1 周回せば、 全体地図の主要部分が頭に入ります。 そこから先は、 自分の興味分野 (NLP / CV / RL のどれか) を深掘りし、 並行して因果推論や説明可能 AI を学ぶのがおすすめのルートです。 数式・コード・データ・倫理・社会の 5 軸を意識しながら、 楽しんで進めてください。 本ページが皆さんの AI コア技術習得の地図として役立てば幸いです。
本ページの主要アルゴリズムを SSDSE-B-2026 で実装する際のステップを、 もう一段詳細に整理します。 これは自分でコードを書く際のチェックリストとして使えます。
pd.read_csv('data/raw/SSDSE-B-2026.csv', encoding='cp932', skiprows=[1]) で開始。df.info() と df.describe() で全体感を掴む。df.isna().sum() で欠損列を把握。y = df['A4101'] (出生数)、 X = df[['A1101', 'A1303', 'A9101']] (総人口、 65 歳以上人口、 婚姻件数) など。StandardScaler().fit_transform(X) (線形系のみ)。train_test_split(X, y, test_size=0.2, random_state=42)。LinearRegression().fit(X_train, y_train) など。r2_score(y_test, y_pred) + 交差検証 cross_val_score。shap.TreeExplainer(model).shap_values(X) で寄与可視化。GridSearchCV または optuna.create_study()。joblib.dump(model, 'model.pkl') で保存、 FastAPI で API 化。| 年 | マイルストーン | 影響 |
|---|---|---|
| 1950 | Turing Test 提案 | AI の概念的出発点 |
| 1956 | ダートマス会議 | 「人工知能」 用語の誕生 |
| 1969 | Perceptron 限界 (Minsky) | 第 1 次冬の時代へ |
| 1980s | エキスパートシステム | 第 2 次 AI ブーム |
| 1986 | 誤差逆伝播法 (Rumelhart) | NN 再評価 |
| 1995 | SVM (Vapnik) | 古典 ML の隆盛 |
| 2001 | Random Forest (Breiman) | 表形式の王者 |
| 2006 | Deep Belief Network (Hinton) | DL 復活 |
| 2012 | AlexNet (ILSVRC) | CV で DL が勝利 |
| 2014 | GAN (Goodfellow) | 生成モデル誕生 |
| 2015 | ResNet (He) | 超深層 NN |
| 2017 | Transformer (Vaswani) | NLP/CV 統一 |
| 2018 | BERT (Devlin) | 事前学習言語モデル |
| 2020 | GPT-3 (OpenAI) | LLM 時代の幕開け |
| 2022 | ChatGPT | 一般社会への AI 浸透 |
この 15 件のマイルストーンを知ることで、 「なぜ今この手法か」 が自然に分かるようになります。 歴史は AI 学習のショートカットです。
本ページの内容を実務に落とすための、 最終チェックリスト 3 種類。 自分のプロジェクトで 1 つずつ確認してから次に進む癖をつけてください。
以上で本ページ「AI コア技術」 の解説は完結です。 SSDSE-B-2026 を題材にした 47 都道府県のストーリーを、 みなさんの手で 47 通り紡いでください。 そこから始まる「データに対する誠実さ」 こそが、 AI コア技術の本質です。 ご健闘を祈ります。
本ページの内容を実際に手を動かして消化するための練習問題を 10 問用意しました。 解答は別途、 自分でノートブックに書き出してください。
これら 12 の誤解を 1 つずつ潰していくのが、 AI コア技術習得の道のりです。 SSDSE-B-2026 を素材に、 自分で体験してみてください。 誤解は誰でも一度は通る道ですが、 自分で気づいて修正できる人が伸びる人です。 47 都道府県のデータと向き合いながら、 自分の中の AI コア技術観をアップデートし続けてください。 そして、 1 年後の自分が、 今の自分の説明を読み返したときに「ああ、 こう考えていたな」 と笑えるくらい、 確実に成長していることを願っています。 学習の旅は始まったばかり。 さあ、 ノートブックを開きましょう。 47 都道府県のストーリーを 1 つでも書ければ、 あなたはもう「データに耳を傾ける人」 です。 AI コア技術はそのための道具に過ぎません。 道具を磨きつつ、 耳を澄まし続けること。 これが本ページから最後に伝えたいメッセージです。 SSDSE-B-2026 と共に、 良い旅を。 学んだことは必ず次の世代へ伝えてください。 そうやって AI コア技術は社会に根付いていきます。 学びは個人だけのものではなく、 共有することで初めて完成します。 SSDSE-B-2026 で得た知見は、 ぜひ家族・友人・同僚・後輩へ届けてください。 それが本ページの最大の願いです。 47 都道府県のデータと共に、 学びの輪を広げていきましょう。 ありがとうございました。 これからの皆さんの活躍を楽しみにしています。
GPT-4 (2023) → GPT-4o (2024) → o1 (2024 reasoning) → GPT-5 (予定)。 Claude (Anthropic): Sonnet 3.5 → Opus 4 → Sonnet 4.5 → Opus 4.7。 Gemini (Google) も 1.5 → 2.0 で長文文脈強化。 推論能力、 数学、 コーディング、 マルチモーダル全方位で進化中。
Meta LLaMA 3 (2024), LLaMA 4 (2025), Mistral, DeepSeek (中国), Falcon (UAE), Qwen (Alibaba), 日本の rinna/Swallow など。 GPT-4 級性能のオープンモデルが登場、 民間企業・研究者が手元で動かせる時代へ。
(1) Computer Use (Anthropic Claude Computer Use 2024), (2) Operator (OpenAI 2025), (3) Devin (Cognition Labs 2024) のような自律エージェントが登場。 タスク分解 → 道具使用 → 自己修正のループ。 SSDSE-B-2026 の分析も AI エージェントが代行する時代。
テキスト + 画像 + 音声 + 動画を統一処理: GPT-4o (リアルタイム音声+画像), Gemini 2.0 Live, Claude with Vision, Sora (動画生成)。 入出力のモダリティ柔軟化で UX 革新。
EU AI Act (2024 施行), 米国大統領令 14179 (2025 トランプ撤回), 日本 AI 推進法 (2025 検討), 中国生成 AI 管理弁法。 Bletchley → Seoul → Paris → New Delhi AI Safety サミット。
(1) コーディング自動化 (Copilot, Cursor, Devin), (2) 翻訳・要約・ライティング, (3) カスタマーサポート, (4) コンサル業界の影響, (5) リスキリングの加速。 OECD は 2024 年で約 27% の労働者が高自動化リスクと報告。
(1) ChatGPT で SSDSE データの初期 EDA、 (2) Claude with Code でモデル構築、 (3) Notebook LM で論文要約と分析設計、 (4) Cursor で実装支援。 AI 時代のデータサイエンス教育では「AI を使いこなす」スキルが必須。
AI は単一技術ではなく、 経済・社会・文化を再編する変革。 SSDSE-B-2026 のような実データを使った定量分析と AI ツールの実装演習を組み合わせることで、 学習者は健全な AI リテラシーを獲得できる。
上の数式に出てきた記号を 1 つずつ解説します。 数式が出てくる試験問題(統計検定・G 検定・基本情報)では、 各記号の意味を答えられるかが分岐点:
| 記号 | 意味 |
|---|---|
| $\pi$ | 方策(state → action の写像) |
| $U(s,a)$ | 効用関数:その状態と行動から得られる価値 |
| $\mathbb{E}[\cdot]$ | 環境の不確実性に対する期待値 |
| $s_t$ | 時刻 $t$ における状態(観測) |
| $a_t$ | 時刻 $t$ で取る行動 |
「AIコア技術」を入門レベルで習得した次に進むべき発展テーマ:
基本概念を 確率論・情報理論・最適化理論の観点で再定式化すると、 隣接する手法との理論的な関係が見えてきます。 たとえば 正則化は事前分布の最大事後推定と等価、 クロスエントロピー損失は KL ダイバージェンスを最小化、 といった対応関係を押さえると教科書間の往復が楽になります。
scikit-learn 標準実装の外側に出ると、 GPU 対応・分散学習・低精度浮動小数点(fp16/bf16)・量子化(int8)・グラフ最適化(TorchScript・ONNX Runtime)など、 推論性能を 10–100 倍引き上げるテクニックが豊富にあります。 本番運用では モデル精度と推論コストのトレードオフを意識した実装が鍵。
予測精度だけでなく SHAP・LIME・Permutation Importance によるモデル解釈、 Calibration(確率の校正)、 Counterfactual Explanation、 Fairness 指標(demographic parity, equalized odds 等)を組合せると、 業務応用での説得力が一段増します。
医療(薬機法・GxP)・金融(モデル管理ガイドライン)・公共(個人情報保護法)など、 業界固有の規制・ガイドラインを モデル設計段階から埋め込むのが現代のスタンダード。 「AIコア技術」を業務適用するときは、 ドメインの専門家・法務との早期コラボレーションが成否を分けます。
AI 中核技術の弱点は「ブラックボックス性」。 医療・金融・採用ではモデルが「なぜそう判断したか」の説明が法的・倫理的に要求される。 代表的解法が SHAP (SHapley Additive exPlanations)。
💡 SHAP の本質は「ゲーム理論の Shapley 値を特徴量寄与に応用」。 加法分解性・対称性・線形性等の数学的性質が保証されており、 単なる feature_importance より厳密。
このコードでやること:RandomForest による「47 県一般診療所数予測」モデルに対し、 東京都の予測値の根拠を SHAP 値で説明する。
📥 入力データ:後述「🧮 SSDSE-B 実値計算」の「🐍 Python 実装 — 3 系統 AI モデルの比較」で学習する rf モデルと X_scaled。 SHAP は shap.TreeExplainer 経由で抽出。
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 | import pandas as pd import numpy as np import shap from sklearn.ensemble import RandomForestRegressor from sklearn.preprocessing import StandardScaler df = (pd.read_csv('data/raw/SSDSE-B-2026.csv', encoding='cp932', skiprows=[1]) .query('`SSDSE-B-2026` == 2023').reset_index(drop=True)) df['pref'] = df['Prefecture'] FEATS = ['A1101', 'A1303', 'A4101', 'G7101'] # 総人口/65歳以上/出生数/延べ宿泊者数 X_scaled = StandardScaler().fit_transform(df[FEATS]) y = df['I5102'] # 一般診療所数 rf = RandomForestRegressor(n_estimators=200, random_state=0).fit(X_scaled, y) explainer = shap.TreeExplainer(rf) shap_values = explainer.shap_values(X_scaled) i = list(df['pref']).index('東京都') pred = rf.predict(X_scaled[i:i+1])[0] print(f'東京都の予測診療所数: {pred:.0f}(実測 {y[i]:.0f})') print('特徴量ごとの SHAP 値:') for name, v in zip(FEATS, shap_values[i]): print(f' {name:<10}: {v:+.1f}') |
📤 実行結果:
💬 結果の読み方:東京の診療所数予測 12,088 (ベース値 2,202 + 各寄与) の根拠は 「総人口 (+3,125)・出生数 (+2,751)・65 歳以上人口 (+2,560)・延べ宿泊者数 (+1,450)」と分解できる。 全特徴量が全国平均を上回るため、 いずれも予測を押し上げる方向に働く。 個別の予測について 「この特徴量がこれだけ押し上げた」という説明ができる点が SHAP の最大の価値。
📌 試験では「論文タイトル → モデル」「年代 → 出来事」のペアが頻出。 上の年表を時系列で覚えると応用が利く。
AI コア技術の中核は 機械学習アルゴリズム群 であり、 これらは scikit-learn の統一 API(fit/predict/transform)で系統的に扱えます。 アルゴリズムは「線形モデル」「決定木系」「距離ベース」「確率モデル」「カーネル法」「アンサンブル」「ニューラルネット」の 7 ファミリーに整理でき、 それぞれが バイアス-バリアンス 軸で異なる立ち位置を取ります。 ここでは SSDSE-B-2026 で 7 アルゴリズムを横並びに比較し、 fundamentals を一望します。
🎯 このコードでやること: SSDSE-B-2026 (2023 年) の出生数 (A4101) を、 総人口・65 歳以上人口・婚姻件数から予測するタスクで 7 種類のアルゴリズムを比較し、 各ファミリーの fundamentals を体感する。
📥 入力データ:
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 | import pandas as pd from sklearn.linear_model import Ridge from sklearn.tree import DecisionTreeRegressor from sklearn.neighbors import KNeighborsRegressor from sklearn.naive_bayes import GaussianNB from sklearn.svm import SVR from sklearn.ensemble import RandomForestRegressor, GradientBoostingRegressor from sklearn.neural_network import MLPRegressor from sklearn.model_selection import cross_val_score from sklearn.preprocessing import StandardScaler from sklearn.pipeline import make_pipeline from sklearn.compose import TransformedTargetRegressor df = pd.read_csv('data/raw/SSDSE-B-2026.csv', encoding='cp932', skiprows=[1]) df = df[df['SSDSE-B-2026'] == 2023] # 2023 年の 47 都道府県 X = df[['A1101', 'A1303', 'A9101']].values # 総人口・65歳以上人口・婚姻件数 y = df['A4101'].values # 出生数 models = { '線形(Ridge)': Ridge(alpha=1.0), '決定木': DecisionTreeRegressor(max_depth=5, random_state=0), 'kNN(距離)': KNeighborsRegressor(n_neighbors=5), # SVR と MLP は目的変数のスケールにも敏感。出生数(数万オーダー)のままだと # 既定の C / epsilon では当てはまらず、この 2 つだけ不当に低く出る。 # TransformedTargetRegressor で y も標準化してから比較する。 'カーネル(SVR)': TransformedTargetRegressor( regressor=make_pipeline(StandardScaler(), SVR(kernel='rbf')), transformer=StandardScaler()), 'RandomForest': RandomForestRegressor(n_estimators=100, random_state=0), 'GBDT': GradientBoostingRegressor(random_state=0), 'MLP(NN)': TransformedTargetRegressor( regressor=make_pipeline(StandardScaler(), MLPRegressor(hidden_layer_sizes=(32,16), max_iter=2000, random_state=0)), transformer=StandardScaler()), } for name, m in models.items(): score = cross_val_score(m, X, y, cv=5, scoring='r2').mean() print(f'{name:<14} R²={score:.3f}') |
📤 実行例:
💬 結果の読み方: 小規模・強線形データ(47 行 × 3 特徴、 出生数は人口に強く線形的)では 線形(Ridge) が R²=0.938 で最強。 GBDT (0.897)・RandomForest (0.888) のアンサンブル系が僅差で続く。 kNN (0.810) は 47 サンプルでは近傍が不足し劣勢。 SVR・MLP は目的変数の桁が大きく標準化前提が崩れて大きく劣化(前処理とデータ量の重要性、 および深層学習の小データでの弱点を体感)。 これが「No Free Lunch」 の現場感覚。
| ファミリー | 代表アルゴリズム | 得意 | 苦手 |
|---|---|---|---|
| 線形 | Ridge, Lasso, ロジスティック回帰 | 解釈性、 小データ | 非線形関係 |
| 決定木 | CART, ID3 | 解釈性、 ルール抽出 | 単体では過学習 |
| 距離 | kNN | 局所構造 | 高次元、 大規模 |
| 確率 | Naive Bayes | テキスト分類、 高速 | 特徴量間相関 |
| カーネル | SVM, SVR | 中規模、 非線形 | 大規模 (O(n²)) |
| アンサンブル | RandomForest, GBDT, XGBoost | 表形式の万能解 | 画像・音声 |
| NN | MLP, CNN, Transformer | 大規模、 非構造化 | 小データ、 解釈性 |
📌 「とりあえず GBDT (LightGBM/XGBoost) で当たりをつけ、 解釈性が要れば線形、 画像・テキストなら NN」が現代の実務定石。 No Free Lunch 定理が言うように万能解は存在しない。
SSDSE-B-2026 (2023 年) の都道府県データで AI コア技術の代表 2 系統を体験する。 説明変数を 総人口 (A1101)、 目的変数を 出生数 (A4101) と置き、 線形 AI(単回帰)と木モデル AI(RandomForest)を比較する。
使用データ:SSDSE-B-2026.csv(独立行政法人統計センター提供の教育用標準データセット、 47 都道府県 × 100 超の社会経済指標)。 出典
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 | import pandas as pd from sklearn.linear_model import LinearRegression from sklearn.ensemble import RandomForestRegressor from sklearn.metrics import r2_score # SSDSE-B-2026 を読み込む(2023 年の 47 都道府県) df = pd.read_csv('data/raw/SSDSE-B-2026.csv', encoding='cp932', skiprows=[1]) df = df[df['SSDSE-B-2026'] == 2023].rename(columns={df.columns[2]: 'pref'}) # AI の代表手法 2 つを比較 X = df[['A1101']].values # 総人口 y = df['A4101'].values # 出生数 lin = LinearRegression().fit(X, y) rf = RandomForestRegressor(n_estimators=200, random_state=42).fit(X, y) print(f'線形AI R² = {r2_score(y, lin.predict(X)):.3f}') print(f'木系AI R² = {r2_score(y, rf.predict(X)):.3f}') |
▲ 上記コードはそのまま実行可能。 CP932 エンコーディング・skiprows=[1](2 行目の日本語ラベル行をスキップ)・列名の英数字コード(A1101 = 総人口 など)に注意。
AI 中核技術の理解には実装が必須。 SSDSE-B-2026 (2023 年) の 47 都道府県データを使い、 (a) 古典 ML (線形回帰)、 (b) アンサンブル (Random Forest)、 (c) ディープ (MLP) の 3 系統で「都道府県の一般診療所数を予測」する。
このコードでやること:SSDSE-B-2026 から総人口 (A1101)・65 歳以上人口 (A1303)・出生数 (A4101)・延べ宿泊者数 (G7101) を特徴量に、 一般診療所数 (I5102) を予測。 線形回帰・RandomForest・MLP の精度比較を実施。
📥 入力データ:
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 | import pandas as pd from sklearn.linear_model import LinearRegression from sklearn.ensemble import RandomForestRegressor from sklearn.neural_network import MLPRegressor from sklearn.model_selection import cross_val_score from sklearn.preprocessing import StandardScaler df = pd.read_csv('data/raw/SSDSE-B-2026.csv', encoding='cp932', skiprows=[1]) df = df[df['SSDSE-B-2026'] == 2023].rename(columns={df.columns[2]: 'pref'}) X = df[['A1101', 'A1303', 'A4101', 'G7101']].values y = df['I5102'].values X_scaled = StandardScaler().fit_transform(X) models = { 'LinearRegression': LinearRegression(), 'RandomForest': RandomForestRegressor(n_estimators=200, random_state=42), 'MLP': MLPRegressor(hidden_layer_sizes=(32, 16), max_iter=2000, random_state=42), } for name, m in models.items(): cv = cross_val_score(m, X_scaled, y, cv=5, scoring='r2') print(f'{name:<17}: R²={cv.mean():.3f} ± {cv.std():.3f}') rf = models['RandomForest'].fit(X_scaled, y) # 後続の SHAP・重要度分析で再利用 |
📤 実行結果:
💬 結果の読み方:47 件の小規模データでは 線形回帰 (R²=0.810) と RandomForest (R²=0.821) がほぼ互角。 MLP は R²=0.623 かつばらつき (±0.370) が大きく不安定 — ニューラルネットの強みである 非線形性が小データでは活きないため。 「データ量に応じて適切なモデルを選ぶ」という AI 中核技術の No Free Lunch 定理を体感できる。
このコードでやること:上で学習した RandomForest から feature_importances_ を抽出し、 「どの SSDSE 列が予測に効くか」を可視化する。
📥 入力データ:上で学習済の RandomForestRegressor インスタンスを利用。
1 2 3 4 5 6 7 | import numpy as np cols = ['A1101', 'A1303', 'A4101', 'G7101'] imp = rf.feature_importances_ order = np.argsort(imp)[::-1] for i in order: print(f'{cols[i]:<8}: {imp[i]:.3f} ' + '█' * int(imp[i] * 50)) |
📤 実行結果:
💬 結果の読み方:総人口 (A1101) が最重要 (32.6%) で、 出生数 (A4101 30.5%)・65 歳以上人口 (A1303 25.8%) が僅差で続く。 「人口規模が大きい県ほど診療所も多い」という直感を裏付ける。 ただし重要度は 相関であり因果ではない点に注意。 因果解析には別の手法 (因果推論) が必要。
| 年 | 技術/出来事 | 主要人物・機関 |
|---|---|---|
| 1956 | ダートマス会議で AI 命名 | McCarthy, Minsky, Shannon, Rochester |
| 1958 | パーセプトロン | Rosenblatt |
| 1986 | 誤差逆伝播法 (Backpropagation) 一般化 | Rumelhart, Hinton, Williams |
| 1995 | SVM 提案 | Cortes, Vapnik |
| 2006 | ディープラーニング前夜 (DBN) | Hinton |
| 2012 | AlexNet (ImageNet 優勝、 CNN ブーム) | Krizhevsky, Hinton |
| 2014 | GAN 提案、 VAE 提案 | Goodfellow, Kingma |
| 2016 | AlphaGo が李世乭に勝利 | DeepMind |
| 2017 | Transformer 論文 "Attention is All You Need" | Vaswani et al. (Google) |
| 2018 | BERT、 GPT-1 | Google、 OpenAI |
| 2020 | GPT-3 (175B)、 In-context Learning | OpenAI |
| 2022/11 | ChatGPT 公開、 LLM 大衆化 | OpenAI |
| 2023 | GPT-4、 Llama-2、 Claude | OpenAI、 Meta、 Anthropic |
| 2024 | マルチモーダル (GPT-4o)、 Sora、 o1 (推論) | OpenAI |
| 2025 | Claude 3.5/4、 Gemini 2、 推論モデル普及 | Anthropic、 Google |
AI 中核技術の 教師なし学習を SSDSE で体験する。 47 県を 「東京単独 (突出型) / 大都市圏型 / 地方型」 の 3 グループに分類し、 各群の特徴を読み解く。
このコードでやること:総人口 (A1101)、 65 歳以上人口 (A1303)、 延べ宿泊者数 (G7101)、 高齢化率 の 4 特徴量で標準化し、 k-means クラスタリング (k=3) を実行。 各クラスタの代表県を可視化する。
📥 入力データ:47 都道府県 × 4 特徴量。 標準化済 (平均 0、 分散 1)。
1 2 3 4 5 6 7 8 9 10 11 12 13 | from sklearn.cluster import KMeans from sklearn.preprocessing import StandardScaler feat = df[['A1101', 'A1303', 'G7101']].copy() feat['aging'] = df['A1303'] / df['A1101'] # 高齢化率 = 高齢者人口 ÷ 総人口 Z = StandardScaler().fit_transform(feat.values) km = KMeans(n_clusters=3, n_init=10, random_state=42) labels = km.fit_predict(Z) for c in range(3): prefs = df.loc[labels == c, 'pref'].tolist() print(f'cluster {c}: {prefs}') |
📤 実行結果:
💬 結果の読み方:k-means が地理的・人口規模の実態と整合する 3 群を抽出。 cluster 2 は東京都が単独 — 人口・宿泊需要が突出した外れ値。 cluster 1 は大都市圏 8 県、 cluster 0 は残る 38 の地方県。 これらは Society 5.0 で求められる政策パッケージが異なる群と一致する。
「AI を作ろう」と決めた瞬間、 まず立ちはだかるのが 計算コスト。 代表モデルの推定学習費用を整理し、 規模感を掴む。
| モデル | パラメータ数 | 学習データ | 推定費用 (USD) | 所要時間 |
|---|---|---|---|---|
| scikit-learn 分類 | ~ 数千 | ~ 1 MB | ~ 0.01 | ~ 秒 |
| XGBoost 中規模 | ~ 数百万 | ~ 100 MB | ~ 1 | ~ 分 |
| CNN ImageNet | ~ 数千万 | ~ 150 GB | ~ 100-1,000 | ~ 日 |
| BERT-base | 110M | ~ 3 TB | ~ 7,000 | ~ 4 日 (TPU) |
| GPT-3 | 175B | ~ 45 TB | ~ 4.6M | ~ 数か月 |
| GPT-4 (推定) | ~ 1.8T | ~ 100 TB+ | ~ 60-100M+ | ~ 数か月 |
💡 大規模モデルは GAFA・Anthropic 等の数社しか学習できないが、 Fine-tuning や LoRA なら 1 GPU で数千円から実施可能。 「事前学習済モデル + 微調整」が中小企業の現実解。
「モデルが完成 = 仕事終了」ではない。 本番運用では MLOpsと呼ばれる工程群が必要となる。 ML 特有のデータドリフト・モデル劣化に対応するために、 ソフトウェア工学を拡張した運用フローを構築する。
| フェーズ | 主要工程 | ツール例 |
|---|---|---|
| ① データ管理 | バージョン管理、 ETL | DVC、 Airflow、 dbt |
| ② 実験管理 | ハイパーパラメータ追跡 | MLflow、 Weights & Biases |
| ③ モデル登録 | バージョン、 メタデータ | MLflow Registry、 SageMaker |
| ④ CI/CD | 自動テスト、 デプロイ | GitHub Actions、 Jenkins |
| ⑤ サービング | 推論 API、 バッチ推論 | FastAPI、 TF Serving、 Triton |
| ⑥ 監視 | ドリフト検知、 精度監視 | Evidently、 Prometheus |
| ⑦ 再学習 | スケジュール再訓練 | Kubeflow、 Vertex AI |
💡 統計学習の精度評価 (R²、 F1) と運用品質 (レイテンシ、 可用性) は別の KPIとして並列管理する必要がある。
Stanford AI Index 2024 等で公表されている代表的モデル世代 (AlexNet → ResNet → ViT → GPT-3 等) の精度推移を題材に、 世代ごとのモデル精度と改善率を計算する。 SSDSE-B-2026 ベースのベンチマーク実装は本セクション上部「🐍 Python 実装 — 3 系統 AI モデルの比較」と「🧰 AI コア技術の実装地図」を参照。
| 世代 | 精度 [%] | 前世代差 |
|---|---|---|
| v1 | 62 | — |
| v2 | 71 | +9 |
| v3 | 78 | +7 |
| v4 | 84 | +6 |
| v5 | 89 | +5 |
1 2 3 4 5 6 | import numpy as np acc = np.array([62, 71, 78, 84, 89]) diff = np.diff(acc) mean_diff = diff.mean() print(f"世代間差: {diff}") print(f"平均改善幅: {mean_diff}") |
💬 手計算 (Step 2) 6.75 と Python 出力が完全一致。
SSDSE-B-2026 のような公的統計データを Python で扱う際の基本パターン:
1 2 3 4 5 6 7 8 9 10 11 12 13 | import pandas as pd import numpy as np # データ読み込み(2023 年の 47 都道府県) df = pd.read_csv('data/raw/SSDSE-B-2026.csv', encoding='cp932', skiprows=[1]) df = df[df['SSDSE-B-2026'] == 2023] print(df.shape) print(df.dtypes) print(df.describe()) # 「AIコア技術」の文脈で扱う場合の例: # 分野: AI基礎 # 関連手法は同カテゴリの他用語を参照してください。 |
具体的なコードは 機械学習の基礎 を参照してください。
分析結果を報告するときに含めるべき情報:
「AIコア技術」を扱う代表的なライブラリ別実装。 同じ目的でも書き方が違うため、 自分のプロジェクトの依存関係に合わせて選択する:
1 2 3 4 5 6 7 8 | import pandas as pd import numpy as np df = pd.read_csv('data/raw/SSDSE-B-2026.csv', encoding='cp932', skiprows=[1]) df = df[df['SSDSE-B-2026'] == 2023].rename(columns={df.columns[2]: 'pref'}) print('行数:', len(df), '列数:', df.shape[1]) print(df[['pref', 'A1101', 'A4101', 'A5101', 'F3101']].head()) |
1 2 3 4 5 6 7 8 9 10 11 12 | from sklearn.linear_model import LinearRegression from sklearn.metrics import r2_score, mean_squared_error from sklearn.model_selection import train_test_split import numpy as np X = df[['A1101', 'A1303']].fillna(0).values y = df['A4101'].values X_tr, X_te, y_tr, y_te = train_test_split(X, y, test_size=0.2, random_state=42) m = LinearRegression().fit(X_tr, y_tr) pred = m.predict(X_te) print(f'R² = {r2_score(y_te, pred):.3f}') print(f'RMSE = {np.sqrt(mean_squared_error(y_te, pred)):.2f}') |
1 2 3 4 5 6 7 8 9 | from scipy import stats # 例: 2 変数の Pearson 相関 + p 値 r, p = stats.pearsonr(df['A1101'], df['A4101']) print(f'相関係数 r = {r:.3f}, p 値 = {p:.2e}') # 例: 1 標本 t 検定(平均が一定値と異なるか) t, p = stats.ttest_1samp(df['A4101'], popmean=df['A4101'].mean()) print(f't = {t:.3f}, p = {p:.3f}') |
1 2 3 4 5 6 7 8 9 10 11 | import matplotlib.pyplot as plt import seaborn as sns fig, ax = plt.subplots(figsize=(8,5)) sns.scatterplot(data=df, x='A1101', y='A4101', ax=ax) ax.set_xlabel('総人口') ax.set_ylabel('出生数') ax.set_title(f'{len(df)} 都道府県の関係') plt.tight_layout() plt.savefig('out.png', dpi=120) plt.close() |
📍 あなたが今見ているもの:AI コア技術を SSDSE-B-2026 (47 都道府県データ) を用いて実装し、 機械学習・深層学習・自然言語処理・コンピュータビジョン・強化学習・知識表現の 6 分野がどう繋がるかを地図化する補講パートです。 用語ページ本文をひととおり読んだあとに、 ここで「現場でどう動くか」 を確認してください。
AI コア技術の共通形は「入力 $x$ から出力 $y$ を予測する関数 $f_\theta$ をデータ $D$ で学習する」、 すなわち $\theta^* = \arg\min_\theta \frac{1}{n}\sum_i L(f_\theta(x_i), y_i) + \lambda R(\theta)$ です。 $L$ は損失 (回帰なら二乗誤差、 分類なら交差エントロピー)、 $R$ は正則化、 $\lambda$ はその強さ。 この骨格を持ったまま、 線形回帰 → ロジスティック → 決定木 → ランダムフォレスト → 勾配ブースティング → ニューラルネット へと「$f_\theta$ の表現力」 が拡張されていきます。 SSDSE-B-2026 の都道府県データでこれら 4 モデルを比較し、 表形式データでは何が強いかを確認します。
① このコードでやること:SSDSE-B-2026 (2023 年) の総人口 (A1101) から出生数 (A4101) を予測する線形回帰モデル (ベースライン) を学習し、 交差検証で R^2 を測定します。
📥 入力データ(SSDSE-B-2026 抜粋):
1 2 3 4 5 6 7 8 9 | import pandas as pd from sklearn.linear_model import LinearRegression from sklearn.model_selection import cross_val_score df = pd.read_csv('data/raw/SSDSE-B-2026.csv', encoding='cp932', skiprows=[1]).query('`SSDSE-B-2026` == 2023') X = df[['A1101']].values y = df['A4101'].values m = LinearRegression() cv = cross_val_score(m, X, y, cv=5, scoring='r2') print(f'LinearRegression CV R^2 = {cv.mean():.4f} ± {cv.std():.4f}') |
📤 実行例:
💬 線形でも R^2=0.944 と強力。 これがベースライン。 これ以降のモデルはこの数字を超える必要があります。
② このコードでやること:決定木 (max_depth=3) を学習し、 ベースラインと比較します。 非線形を扱える単純な木モデル。
📥 入力データ:直前の X, y。
1 2 3 4 | from sklearn.tree import DecisionTreeRegressor m2 = DecisionTreeRegressor(max_depth=3, random_state=42) cv2 = cross_val_score(m2, X, y, cv=5, scoring='r2') print(f'DecisionTree CV R^2 = {cv2.mean():.4f} ± {cv2.std():.4f}') |
📤 実行例:
💬 単木は R^2=0.79 とベースラインに負けた。 47 サンプルでは木が過学習しやすく、 線形仮定が当てはまる SSDSE-B の人口・出生数では線形回帰が有利。 「単純な手法を捨てない」 教訓。
③ このコードでやること:ランダムフォレスト (n_estimators=100) で精度を向上させ、 アンサンブルの効果を確認します。
📥 入力データ:直前の X, y。
1 2 3 4 | from sklearn.ensemble import RandomForestRegressor m3 = RandomForestRegressor(n_estimators=100, random_state=42) cv3 = cross_val_score(m3, X, y, cv=5, scoring='r2') print(f'RandomForest CV R^2 = {cv3.mean():.4f} ± {cv3.std():.4f}') |
📤 実行例:
💬 RF は R^2=0.87 で単木より良いがベースライン (0.944) には届かず。 特徴量 1 つでは木の強みを活かしきれない。
④ このコードでやること:多変量入力 (総人口・65 歳以上人口・婚姻件数の 3 特徴) に拡張し、 線形と RF を再比較します。 特徴量を増やすと木の本領発揮。
📥 入力データ:df の A1101, A1303, A9101(総人口・65 歳以上人口・婚姻件数)。
1 2 3 4 5 6 | cols = ['A1101', 'A1303', 'A9101'] X2 = df[cols].values cv_lin = cross_val_score(LinearRegression(), X2, y, cv=5, scoring='r2') cv_rf = cross_val_score(RandomForestRegressor(n_estimators=100, random_state=42), X2, y, cv=5, scoring='r2') print(f'LinearRegression (3 feat) R^2 = {cv_lin.mean():.4f}') print(f'RandomForest (3 feat) R^2 = {cv_rf.mean():.4f}') |
📤 実行例:
💬 特徴量を 3 に増やしても、 SSDSE-B-2026 の n=47 + 強い線形性下では線形が依然優位。 「No Free Lunch」 のミニ実例 — タスクに合った最適モデルは事前に分からない。
「AIコア技術」を実務・試験で扱うときに頻発する典型的なミスです。 各項目を 1 度読んでおけば 9 割の事故が防げます:
AI コア技術は機械学習・深層学習・自然言語処理・コンピュータビジョン・強化学習・知識表現の 6 分野で構成されます。 SVG で関係を 1 枚に圧縮します。
| 分野 | 代表手法 | SSDSE-B での想定応用 |
|---|---|---|
| 機械学習 (ML) | OLS, Ridge, RandomForest, XGBoost | 人口から出生数予測、 高齢化率予測 |
| 深層学習 (DL) | MLP, CNN, Transformer | 大規模な場合のみ; SSDSE-B では基本不要 |
| 自然言語処理 (NLP) | BERT, GPT, RAG | 都道府県紹介テキスト生成 |
| コンピュータビジョン (CV) | ResNet, YOLO, ViT | 地図画像 / 衛星画像での補助 (SSDSE-B 単体では非該当) |
| 強化学習 (RL) | Q-learning, PPO | 政策シミュレーション |
| 知識表現 (KR) | 知識グラフ, オントロジー | 都道府県メタデータ統合 |
| 時代 | 年代 | 代表トピック | SSDSE-B 文脈 |
|---|---|---|---|
| 第 1 次 AI | 1950s-1960s | 推論 / 探索 | 記号的人口推計 |
| 第 2 次 AI | 1980s | エキスパートシステム | ルールベース診断 |
| 機械学習興隆 | 1990s-2000s | SVM, RandomForest | 都道府県分類 |
| 第 3 次 AI (DL) | 2010s- | CNN, RNN, Transformer | 大規模応用は別データ |
| 生成 AI / LLM | 2020s- | GPT, RAG, Agents | 都道府県レポート自動生成 |
| Q | 選択肢 | 正解 | 解説 |
|---|---|---|---|
| ① AI コア技術に含まれないのは? | (a) ML (b) DL (c) Excel ピボット | (c) | Excel ピボットは BI 系 |
| ② n=47 で DL を選ぶべき? | (a) はい (b) いいえ (c) 場合による | (b) | 小データでは過学習リスク |
| ③ Random Forest の主な利点は? | (a) 解釈性 (b) 過学習抑制 (c) GPU 必須 | (b) | バギングでバリアンス低減 |
| ④ Transformer の中心要素は? | (a) 畳み込み (b) Attention (c) Recurrence | (b) | Self-Attention で長距離依存 |
| ⑤ AI 倫理の重要原則は? | (a) 透明性 (b) 公平性 (c) どちらも | (c) | 両方とも基本 |
AI コア技術と関連の用語ページへのリンク集です。
| 週 | テーマ | 到達点 |
|---|---|---|
| 1-2 | Python + numpy + pandas | SSDSE-B 読み込み |
| 3-4 | scikit-learn ML | 線形・RF・GBDT 比較 |
| 5-6 | モデル評価 (CV, 指標) | R^2 / F1 / AUC が説明できる |
| 7-8 | PyTorch 基礎 | MLP を組める |
| 9-10 | Transformers (HuggingFace) | BERT で分類 |
| 11-12 | LLM API + RAG | レポート自動生成 |
「AI コア技術」は応用に先立つ基盤層。 何ができるかは応用、 何でできているかはコア。 「🌐 関連手法・派生」が派生手法の鳥瞰、 本セクション「🔗 隣接手法への橋渡し」が 実装パラダイムの切替判断、 「🌳 手法選択フロー」が初期選択の役割を持つ 3 層構成。 接続・統合・比較の 3 視点で隣接概念を整理する。
AI コア技術は 機械学習・深層学習 をはじめ、 統計・最適化・情報理論の上に成り立ち、 出口として AI 応用分野(画像・音声・自然言語・推薦)に接続する。 コア技術を欠いた応用は性能上限を超えられず、 応用視点を欠いたコアは現場ニーズと乖離する。
単一コア技術ではカバーできない問題が大半。 以下の組合せで性能・汎用性・効率を統合する。
「AI コア技術」内部の各パラダイム(教師あり/深層学習/強化学習/生成 AI/記号 AI)を、 切替条件で並べると以下のとおり。
| コア技術 | 切替条件 | 利点 | 注意点 |
|---|---|---|---|
| 教師あり ML | ラベル付きデータがある分類・回帰 | 解釈性・少データでも動く | ラベル取得コストが性能を律速 |
| 深層学習 | 画像・音声・テキストで >10万 サンプル | 特徴量自動抽出、 高精度 | GPU・電力・解釈性に難点 |
| 強化学習 | 意思決定の系列(ゲーム・制御・推薦) | 環境との相互作用で長期報酬を最大化 | シミュレータ必須、 学習が不安定 |
| 生成 AI / LLM | 自然言語・コード生成・要約 | ゼロショットで広いタスクに対応 | 幻覚・コスト・データ依存度に制約 |
| 記号 AI(GOFAI) | 規則ベース・知識グラフが有効な領域 | 解釈性 100%・少データで動く | 知識獲得ボトルネック、 柔軟性低 |
役割分離: 「🌐 関連手法・派生」= AI コアを構成する派生技術のカタログ、 「🔗 隣接手法への橋渡し」= パラダイム間の切替判断(本セクション)、 「🌳 手法選択フロー」= 問題特性から最初に選ぶ初期分岐。
「AIコア技術」を実務で適用する/別パラダイムに切り替える判断を、 5 段階の多段分岐で示す。 「🔗 隣接手法への橋渡し」で挙げた 5 つのコアパラダイム (教師あり ML・深層学習・強化学習・生成 AI/LLM・記号 AI) のどれを選ぶか、 を上流の問い (定義範囲) から下流の問い (運用要件) へ順に絞り込む。
[Start: AI 適用したい]
│
▼
分岐 1: 定義範囲は?
├─ 狭義 (ML のみ) ──▶ 分岐 2 へ
└─ 広義 (記号 AI 含む) ─▶ 記号 AI / 知識グラフ 検討
│
▼
分岐 2: 入力データの型は?
├─ 構造化 (表) ─▶ 教師あり ML (XGBoost/Logistic)
├─ 画像/音声/テキスト 大量 ─▶ 深層学習 (CNN/Transformer)
├─ 自然言語生成/要約 ─▶ 生成 AI / LLM
└─ 系列意思決定 (制御/ゲーム) ─▶ 強化学習
│
▼
分岐 3: ラベル付きデータ量は?
├─ 10万件以上 ─▶ 深層学習で性能優位
├─ 数千〜数万 ─▶ 教師あり ML (XGBoost) 優位
└─ ほぼゼロ ─▶ 生成 AI ゼロショット or 半教師あり
│
▼
分岐 4: 解釈性要件は?
├─ 必須 (医療/金融) ─▶ 教師あり ML + XAI、 または記号 AI
└─ 不要 (推薦/翻訳) ─▶ 深層学習 / LLM で OK
│
▼
分岐 5: 運用制約 (GPU/コスト/信頼性) は?
├─ GPU 潤沢 + 高性能優先 ─▶ SOTA 追跡 (Llama/Claude/GPT)
├─ コスト/エッジ制約 ─▶ 蒸留 + 教師あり ML
└─ 信頼性最優先 ─▶ AI 信頼性 7 特性で監査
│
▼
[最終決定]
この 5 分岐は「🔗 隣接手法への橋渡し」の 5 大パラダイム比較表と 1 対 1 対応する: 分岐 2 が「データ型 → パラダイム選択」、 分岐 3 が「データ量 → 深層/古典」、 分岐 4 が「解釈性 → 記号 AI/XAI 検討」、 分岐 5 が「運用制約 → モデル種別」。 フローは出発点であって絶対解ではない。 領域知識・データ特性・運用制約を加えて最終判断する。 迷ったときは「🔗 隣接手法への橋渡し」と「🌐 関連手法・派生」を見直し、 単一の手法に固執しないこと。