相談窓口に依頼してから、「確認します」と最初の返事が来るまでの待ち時間。AI のレイテンシは、質問や依頼を出してから、返答が見え始めるまで、あるいは処理が終わるまでの待ち時間のことです。
利用者は、AI がどれだけ賢いかと同じくらい、どれだけ待たされるかで使い勝手を判断します。品質がよくても、待ちすぎるものは現場で使われなくなります。精度だけで採用を決めると、実際の運用で定着しないことがあるのはこのためです。
待ち時間はどこで生まれているか
遅さの原因は、モデルの本体だけにあるとは限りません。前後の処理も含めた全体が、待ち時間を決めています。
- 入力が長く、読む量が多い
- モデルが大きく、答えを計算する推論に時間がかかる
- 検索、整形、外部の API の呼び出しが何段階も入る(ツールコーリングを含む処理や、AIエージェントに複数の手順を任せたとき)
- 同時に使う人が増えて、順番待ちの列が伸びる
社内の検索ボットが資料を引いてくるまで待たされる、会話が途切れて感じる。こうした不満は、どの段階で待っているのかを分けて見ないと直せません。
「最初の一文字」と「全部そろうまで」を分けて測る
測るときは、最初の一文字が表示されるまでの時間と、全体が完了するまでの時間を分けます。人が感じる待ち時間と、実際の処理時間は同じではないからです。
時間のかかる処理だけを裏で進めて、先に返せるものから返すなど、体感の待ち時間を減らす設計もあります。品質を比べるベンチマークには、速度の条件も入れておきましょう。検索や外部の呼び出しを増やしたときは、便利さと待ち時間の引き換えになっていないかを見直します。