本文へ移動

ITパスポート試験 · 学習ガイド

データ利活用とAI

データ利活用とAIとは

データ利活用とAIとは、集めたデータから傾向や予測を引き出し、判断や業務に役立てる考え方です。

エルくんが説明する図解。学習100日と評価30日を分離し、評価から学習へ混ぜる矢印に禁止印。
考え方の例:100日分を学習に、別の30日分を評価に使います。学習データでは誤差が小さいのに別データで大きいなら、過学習を疑います。

過去の販売データから需要を予測できれば、仕入れのむだを減らせます。ただし、過去に当たったモデルが将来も当たるとは限りません。

基本の仕組み

基本の仕組みの図解。中央の縦仕切りで、左を学習、右を評価に分ける。左の「学習100日」からモデルへ矢印を引き、モデルから右の評価台へ矢印を引く。右の「別の30日」は評価台に置き、学習側へ戻る矢印は描かない。
覚えること:別の30日を学習に混ぜず評価

100日分を学習に、別の30日分を評価に使います。学習データでは誤差が小さいのに別データで大きいなら、過学習を疑います。

教師あり学習は入力と正解の組から関係を学び、教師なし学習はデータのまとまりなどを見つけます。評価用データを学習へ混ぜないことが、未知のデータでの実力測定につながります。

相関があっても原因とは限りません。気温が上がるとアイスと飲料の売上がともに増えるように、共通の原因で一緒に動くこともあります。

生成AIの中でも、大量の文章で学習した大規模言語モデル(LLM)は文章の生成や要約に使われます。もっともらしい誤りを出すことがあるため、元資料の確認や機密情報を入力しない運用を決めます。

学習方式と評価

学習方式と評価の図解。上段のデータ束から、下段に横並びの「学習用」「検証用」「評価用」へ矢印を分岐させる。学習用と検証用の間には調整の戻り矢印を描き、評価用へは最後に進む片道矢印を描く。
覚えること:検証で調整、評価で未知の性能を最後に確認

教師あり学習は正解付きデータから分類・数値予測を学び、教師なし学習は正解ラベルなしでクラスタリングなどを行います。強化学習は行動と報酬を通じて方策を改善します。生成AIは文章・画像などを作る用途であり、これらの学習方式と同じ分類軸ではありません。

ディープラーニング(深層学習)は、多層のニューラルネットワークを使う機械学習の手法で、画像認識や音声認識、生成AIの基盤に使われます。学習方式とは別の軸であり、教師あり学習などと組み合わせて使います。生成AIがもっともらしい誤りを出力することをハルシネーションといいます。

データは学習用・検証用・評価用に分け、未知のデータに対する性能を確かめます。検証用データは学習中の調整に、評価用データは最後の性能確認に使います。生成AIの出力は事実確認のほか、個人情報・著作権・機密情報の取扱いも確認が必要です。

学習方式と評価
方式学習の手掛かり用途の例
教師あり学習正解付きデータ迷惑メールの判定、売上の予測
教師なし学習正解ラベルのないデータ顧客のグループ分け(クラスタリング)
強化学習行動に対する報酬ゲームの攻略、ロボットの制御

試験に出る

  • 学習データと評価データを分ける理由(未知のデータでの実力測定)。
  • 過学習の見分け方。学習では高精度でも未知データで精度が落ちる状態。
  • 教師あり学習と教師なし学習の違い。
  • 相関があっても因果関係とは限らないこと。
  • 生成AIの出力は自然でも真偽が別。元資料の確認や機密情報の管理が必要。

重要な言葉

機械学習
データから規則性や関係を学び、予測や分類に使う技術。
過学習
学習データに合いすぎて、未知のデータで精度が落ちる状態。
教師あり学習
入力と正解の組を使って関係を学ぶ方法。
相関
二つの量が一緒に変化する関係。因果関係とは限らない。
大規模言語モデル(LLM)
大量の文章データで学習し、自然な文章を生成するAIモデル。
ディープラーニング
多層のニューラルネットワークで特徴を自動的に学ぶ機械学習の手法。

確認問題

確かめよう学習に使った100日だけで精度を評価してよい?

いいえ。未知データへの対応力を確認できないからです。

評価用データを学習に混ぜると、未知のデータへの実力を正しく測りやすくなる。

相関が高い二つの量には、必ず因果関係がある。

入力と正解の組から関係を学ぶ方法は?

学習データでは高精度なのに未知データで精度が落ちる状態は?

過去のから需要をできれば、仕入れのむだを減らせます。ただし、過去に当たったモデルが将来も当たるとは限りません。

100日分を学習に、別の30日分を評価に使います。では誤差が小さいのに別データで大きいなら、を疑います。

は入力と正解の組から関係を学び、教師なし学習はデータのまとまりなどを見つけます。を学習へ混ぜないことが、未知のデータでの実力測定につながります。

があっても原因とは限りません。気温が上がるとアイスと飲料の売上がともに増えるように、共通の原因で一緒に動くこともあります。

の中でも、大量の文章で学習した(LLM)は文章の生成や要約に使われます。もっともらしい誤りを出すことがあるため、元資料の確認や機密情報を入力しない運用を決めます。

出典・参考資料

試験の公式案内と、この記事の参考にした学習資料です。

編集:Pinternet Works · 更新日:

教材の編集方針・訂正について