AIと独学

AIに練習問題を作らせて勉強するには?研究でわかった頼み方と確かめ方

約8分で読めます

開いたノートの上に置いたペン
Photo: Jegan12345 / CC BY-SA 4.0 / Wikimedia Commons
AIによる調査公開された研究をAIが調べて整理しました(独自の実験ではありません。出典は末尾)。

教科書を読んだあと、「この範囲の問題を10問作って」とAIに頼む。手軽ですが、本当に身につくのか、問題や答えが間違っていないかが気になります。研究の答えは「問題を解いて思い出す練習は効く。AIの作る問題は人の作る問題に近い質になってきたが、間違いも混ざる。教材を渡して作らせ、答えは教材で確かめる」です。

3行でわかる

  1. 問題を解いて思い出す練習は効く。医療系教育の63の実験のうち43で、間隔をあけた学習か思い出す練習の効果がはっきり出た。選択式より短く答える問題の方が効きやすかった。
  2. AIが作る問題は、新しいモデルでは人の作った問題に近い質だった(15研究のメタ分析、証拠の確かさは「非常に低い」)。それでも、調べたすべての研究で不適切な問題が見つかった。
  3. やり方は、①教材を渡して作らせる ②答えを隠して短く答える問題にする ③自分で答えてから教材で確かめる ④間違えた問題を数日後に解き直す、の4つ。

01 悩みの正体AIに作らせた問題を解くと、なぜ身につく?

問題を解くことで、頭の中から答えを思い出す練習になるからです。読み返すより、思い出す方が記憶に残りやすいことがわかっています。

頭の中から答えを引き出す勉強を「思い出す練習(検索練習)」と呼びます。読み返すより記憶に残りやすいことは、くり返し確かめられています(くわしくは思い出す練習の記事)。

独学で困るのは、問題集のない分野や、自分の弱い所にぴったり合う問題が少ないことです。AIに問題を作らせれば、その穴を埋められます。ただし、AIの作る問題が正しいかどうかは別の話です。

02 科学的にわかっていることAIが作る練習問題は、信用できる?

新しいモデルの問題は、人の作った問題に近い質だったという報告があります。ただし証拠はまだ弱く、どの研究でも不適切な問題が混ざっていました。

Trumbleら(2024)[1]

医療系の学生を対象に、間隔をあけた学習と思い出す練習を調べた56本の論文(63の実験)のシステマティックレビュー。43の実験で、成績がはっきり上がった。問題の形式を比べた4つの研究では、短く答える問題が穴埋めより、何も手がかりなしで思い出す方が選択式より効きやすかった。

対象: 医学・理学療法などの学生 / 限界: 研究のやり方がばらばらで、まとめた効果の大きさは出していない。

Riehmら(2026)[2]

AIと人が作った選択式問題の質を比べた15の研究のネットワーク・メタ分析(複数のAIをまとめて比べる統計の方法)。ChatGPT 4の問題は、内容の的確さ・わかりやすさ・選択肢の質で、人の問題とほぼ同じだった。ChatGPT 3.5とLlama 2の問題は、わかりやすさと選択肢の質が劣っていた。

対象: 医療系教育の問題 / 限界: 証拠の確かさは「非常に低い」。著者らは、学生に実際に解かせて比べる研究が必要だと書いている。

Artsiら(2024)[3]

AIで医学試験の選択式問題を作った8つの研究のシステマティックレビュー。すべての研究で、試験に使えない不適切な問題が見つかった。ChatGPT 4で210問を作った研究では、問題文の誤りが5.7%、答えや選択肢の誤りが6.6%あった。

対象: 2023年11月までの研究 / 限界: 研究の数が少なく、2つはかたよりのリスクが高い。今のAIでは結果が変わっている可能性がある。

Al-Najafiら(2026)[4]

カナダの医学部1年生258人を、AIが作った問題の模試と、上級生が作った問題の模試にランダムに分けた実験。AIの問題は1問あたり4.2分で作れた(上級生は19.6分)。わかりやすさや難しさの感じ方は同じくらいで、点数にもはっきりした差はなかった。問題が実力の差を見分ける力は、上級生の問題の方がやや高かった。

対象: 1つの大学の医学生 / 限界: 教材を見てよい練習用の模試での結果。著者らは、本番の試験や教材なしの試験には当てはまらないかもしれないと書いている。

問題の形式によって、思い出す練習の効き方は違います。AIに頼むときの形式の選び方を、研究をもとに表にしました。

問題の形式研究でわかっていること
選択式(4択など)選択肢を見て選べるので、思い出せなくても答えられることがある[1]
穴埋め手がかりつきで思い出す。単語を埋める方が、文字を埋めるより効いた[1]
短く答える問題穴埋めより効きやすかった[1]
何も見ずに説明する選択式より効きやすかった[1]

03 今日からできる小さな一歩AIに練習問題を作らせるときは、どう頼めばいい?

勉強した範囲の教材を渡し、答えを隠して、短く答える問題を作らせます。自分で答えを書いてから教材で確かめ、間違えた問題は数日後に解き直します。

1

勉強した範囲の教材を渡して作らせる

自分のノートや、教科書の該当ページの要点を貼り付け、「この内容だけから問題を5問作って」と頼みます。AIは事実と違う内容を作ることがあるため[2][3]、出題の元を自分の教材に絞ります。

所要 3分

2

答えは隠し、短く答える問題にする

「答えは最後にまとめて、私が頼むまで見せないで」「選択肢なしの、一言か一文で答える問題にして」と伝えます。短く答える問題や何も見ずに説明する問題の方が、選択式より効きやすかった[1]。

所要 1分

3

自分で答えを書いてから、教材で答え合わせする

答えを紙に書き、AIの答えと比べます。AIの答えと教材が食い違ったら、教材を正しいとします。AIの問題には、答えや選択肢の誤りが数%混ざっていた研究があります[3]。

所要 15分

4

間違えた問題だけを残し、数日後に解き直す

間違えた問題をノートに写し、2〜3日後にもう一度解きます。間隔をあけた学習も、思い出す練習と並んで効果が確かめられています[1]。復習の間隔は復習タイミング計算機で決められます。

所要 10分

04 続けるためのコツAIの問題で、覚えたつもりにならないためには?

AIに答えや解説を先に聞かず、自分で答える時間を必ず取ることです。問題を作らせるのはAI、思い出すのは自分、と役割を分けます。

  • 解けなかったときに、すぐAIに解説を頼まない。まず教材を開いて自分で探す。AIに答えを聞く使い方の落とし穴はAIに答えを聞く勉強の記事で解説している。
  • 同じ範囲で問題を作り直させるときは、「さっきとは違う聞き方で」と頼む。同じ問題をくり返すと、答えの位置や言い回しで覚えてしまう。
  • 解説を読むより、自分の言葉で説明する方が身につく。くわしくは自分で説明する学習の記事へ。

ここで紹介したAIの問題の研究は、医療系の教育で問題の質を調べたものが中心です。AIの作った問題で独学した人の成績を、ほかの勉強法と長期間比べた研究は、今回調べた範囲では見つかりませんでした。手順は、わかっていることを独学に当てはめたものです。

05よくある質問

AIに作らせた問題を解くだけで、勉強になりますか?

問題を解いて思い出すこと自体は、効果が確かめられた勉強法です。ただしAIの問題には誤りが混ざることがあるので、答えは教材で確かめます。AIの問題で独学した人の成績を長期間調べた研究は、まだ見当たりません。

AIが作った問題の答えは、どれくらい間違っていますか?

ChatGPT 4で医学の問題を210問作った研究では、問題文の誤りが5.7%、答えや選択肢の誤りが6.6%でした。AIの種類や分野で変わるので、数字は目安です。教材と食い違ったら、教材を優先します。

選択式と記述式、AIにはどちらの問題を作らせるべきですか?

短く答える問題か、何も見ずに説明する問題がおすすめです。医療系の学生の研究をまとめたレビューでは、短く答える問題が穴埋めより、手がかりなしで思い出す方が選択式より効きやすい結果でした。

出典

  1. Trumble, E., Lodge, J., Mandrusiak, A., & Forbes, R. (2024). Systematic review of distributed practice and retrieval practice in health professions education. Advances in Health Sciences Education, 29(2), 689–714. https://doi.org/10.1007/s10459-023-10274-3
  2. Riehm, L., Nanji, K., Lakhani, M., Pankiv, E., Hasanee, D., & Pfeifer, W. (2026). The use of large language models in generating multiple choice questions for health professions education: A systematic review and network meta-analysis. PLOS ONE, 21(1), e0340277. https://doi.org/10.1371/journal.pone.0340277
  3. Artsi, Y., Sorin, V., Konen, E., Glicksberg, B. S., Nadkarni, G., & Klang, E. (2024). Large language models for generating medical examinations: Systematic review. BMC Medical Education, 24, 354. https://doi.org/10.1186/s12909-024-05239-y
  4. Al-Najafi, D., Krause, K. D., Wang, Y., Zuo, Q. K., Koblanski, M. E., Leong, C. J., Schmidt, E., Faran, M., Verma, V., Vyas, R., Campbell, M., Hwang, J., Deng, J., & Palepu, A. (2026). Psychometric performance and student perceptions of AI- versus student-generated multiple-choice questions: A single-center randomized controlled trial. BMC Medical Education, 26, 1376. https://doi.org/10.1186/s12909-026-09671-0