研修を終えた担当者が、実際の問い合わせにその場で答える。推論は、学習が終わった AI モデルに質問や入力を渡し、実際の答えを返してもらう工程です。チャット AI に質問して回答を受け取る、文章をその場で要約や分類させる、画像や音声を解析して結果を返す、API 経由でモデルを呼び出して業務の流れに組み込む。利用者から見た「AI を使った瞬間」は、ほぼこの推論です。
学習は、大量のデータを見せて、モデルに振る舞いを身につけさせる工程です。推論は、身につけた振る舞いを使って、目の前の入力に答える工程です。LLM の場合、学習が終わっていても、質問を受けるたびに、次にどんな言葉を続けるかを計算して返しています。
モデルを作る工程は一度で済んでも、推論は使うたびに発生します。日々の利用で時間と費用を意識するのは、むしろこちらのほうです。
推論の回数が増えるほど、返事の待ち時間(レイテンシ)と費用が効いてきます。モデルが大きいほど、精度だけでなく待ち時間も確かめておきたいところです。入力が長ければ、処理の時間もトークンの消費も増えます。
ファインチューニングでモデルを用途に寄せても、推論にかかる費用は別の話なので、見直しは別に必要です。そして、推論が速くても、返ってきた内容が正しいとは限りません。重要な業務では、答えを確かめる流れを外さないようにします。