対数損失とは?ログロスの意味・計算式・使い方を初心者向けに解説

AIの初心者
「ログロス」ってなんですか?機械学習の評価指標として出てきますが、正答率と何が違うのかよくわかりません。

AI専門家
ログロスは、モデルが出した確率予測の質を測る指標だよ。正解か不正解かだけでなく、「どれくらい自信を持ってそう予測したか」まで評価するんだ。

AIの初心者
確率の質を測る、ということですか?値が低いほど良いと聞きましたが、理由も知りたいです。

AI専門家
たとえば雨が降る確率を80%と予測して実際に雨が降れば、よい確率予測として損失は小さくなる。反対に、雨が降らないと強く予測したのに雨が降ると、大きな損失として評価されるんだ。
Log Lossとは。
機械学習や統計で使われる「対数損失(ログロス、Log Loss)」は、分類モデルの確率予測を評価するための重要な指標です。
対数損失とは

対数損失とは、分類モデルが出した予測確率と、実際の正解とのずれを測る評価指標です。英語では Log Loss と呼ばれ、日本語ではログロス、交差エントロピー損失と近い文脈で扱われることもあります。
ポイントは、単に当たったか外れたかではなく、どれくらいの確率で予測したかまで評価することです。たとえば「猫である確率90%」と予測して実際に猫だった場合は良い予測です。一方、「猫である確率10%」と予測して実際には猫だった場合は、かなり外れた予測として大きく評価されます。
対数損失は、値が小さいほど良い指標です。理想的には0に近い値を目指します。ただし、データの難しさ、クラス数、モデルの種類によって値の目安は変わるため、別のデータセットのログロスと単純に比べるのではなく、同じ条件のモデル同士で比較するのが基本です。
| 項目 | 内容 |
|---|---|
| 指標名 | 対数損失、ログロス、Log Loss |
| 主な用途 | 分類モデルの予測確率を評価する |
| 値の見方 | 小さいほど良い。0に近いほど正解に高い確率を置けている |
| 重視する点 | 正解・不正解だけでなく、予測の確信度も見る |
対数損失が重視する「確率の質」
正答率は、最終的な予測ラベルが正しかったかどうかを見る指標です。しかし、正答率だけでは、モデルがどれくらい自信を持って予測したのかはわかりません。
たとえば、同じ「正解」でも、正解クラスに90%を割り当てた予測と、51%を割り当てた予測では意味が違います。前者はかなり確信のある予測で、後者はほとんど迷っている予測です。ログロスはこの違いを数値に反映します。
反対に、自信満々に間違えた予測は強く罰せられるのが対数損失の特徴です。実際には猫なのに「猫である確率1%」と出した場合、モデルは正解から遠いだけでなく、間違った方向に強い確信を持っているため、大きな損失になります。
計算式と読み方

二値分類でよく使われる対数損失は、次の式で表せます。
\(LogLoss = -\frac{1}{N}\sum_{i=1}^{N}\{y_i\log(p_i)+(1-y_i)\log(1-p_i)\}\)ここで、\(N\) はデータ数、\(y_i\) は実際の正解ラベル、\(p_i\) はモデルが「正例である」と予測した確率です。二値分類では、正解なら \(y_i=1\)、不正解側なら \(y_i=0\) のように表します。
式は難しく見えますが、考え方はシンプルです。実際に正例なら \(\log(p_i)\) が効き、予測確率 \(p_i\) が1に近いほど損失は小さくなります。実際に負例なら \(\log(1-p_i)\) が効き、正例である確率を低く出せているほど損失は小さくなります。
最後にマイナスを付けるのは、対数の値が0以下になるためです。予測が正解に近いほど対数の値は0に近く、外れるほど大きな負の値になります。それにマイナスをかけることで、損失として扱いやすい正の値にしています。
具体例で見るログロスの値

実際の値の動きを見ると、対数損失の特徴が理解しやすくなります。ここでは「実際には正例だった」として、モデルが正例である確率をいくつ出したかを比べます。
| 実際の答え | 予測確率 | 評価のイメージ | ログロスの傾向 |
|---|---|---|---|
| 正例 | 90% | 正解に高い確率を置けている | 小さい |
| 正例 | 70% | おおむね良いが、90%よりは弱い | やや小さい |
| 正例 | 50% | ほぼ迷っている | 中くらい |
| 正例 | 10% | 正解と反対方向に強く予測している | 大きい |
このように、同じ分類タスクでも、予測確率の出し方によって評価は変わります。機械学習モデルを実務で使う場合、単にラベルを当てるだけでなく、確率の大きさを意思決定に使うことが多いため、ログロスは重要になります。
たとえば不正取引の検知では、「不正の可能性が高い順に調査する」「一定以上の確率なら追加確認する」といった運用があります。このとき、確率が実態に合っていないモデルは、正答率が高く見えても扱いにくいモデルになります。
他の評価指標との違い

機械学習の評価指標には、正答率、適合率、再現率、AUCなどがあります。これらはそれぞれ見る観点が異なるため、ログロスと競合するというより、目的に応じて使い分けるものです。
| 指標 | 見るもの | ログロスとの違い |
|---|---|---|
| 正答率 | 予測ラベルが当たった割合 | 確率の自信度は評価しない |
| 適合率 | 陽性と予測したもののうち、本当に陽性だった割合 | 陽性予測の信頼性を見るが、確率の細かな差は扱わない |
| 再現率 | 実際の陽性をどれだけ拾えたか | 見逃しを重視するが、確率予測の質は直接見ない |
| AUC | 陽性と陰性を順位づける力 | 確率の大小関係を重視し、確率の絶対的な正しさとは別 |
| 対数損失 | 正解にどれだけ適切な確率を置いたか | 確率予測そのものの質を評価する |
たとえば、予測結果を「合格・不合格」のように最終ラベルだけで使うなら、正答率や適合率、再現率がわかりやすい場合があります。一方、予測確率をそのまま判断材料にするなら、対数損失で確率の質を確認する価値が高くなります。
活用される場面

対数損失は、確率を出す分類モデルで広く使われます。画像認識では、画像が猫、犬、車などのどのクラスに属するかを確率で出すモデルの評価に使えます。自然言語処理では、文章がポジティブかネガティブか、問い合わせがどのカテゴリに属するかといった分類で利用できます。
不正検知やリスク判定でもログロスは役立ちます。クレジットカード取引が不正である確率、ユーザーが解約する確率、広告がクリックされる確率など、確率そのものを運用に使う場面では、予測確率が現実に近いかどうかが重要になるからです。
| 分野 | タスク例 | 評価したい確率 |
|---|---|---|
| 画像認識 | 画像分類 | 対象クラスである確率 |
| 自然言語処理 | 感情分析、問い合わせ分類 | 各カテゴリに属する確率 |
| 不正検知 | 不正取引の判定 | 不正である確率 |
| マーケティング | クリック率や解約率の予測 | 行動が起きる確率 |
利点と注意点
対数損失の大きな利点は、確率予測の信頼性を評価できることです。正答率が同じモデルでも、正解に近い確率を安定して出せるモデルの方が、意思決定には使いやすくなります。
一方で、ログロスは極端な予測に敏感です。正解クラスにほぼ0%の確率を置いてしまうと、損失が非常に大きくなります。そのため、実装では予測確率を完全な0や1にしないよう、\(\epsilon\) のような小さな値でクリップすることがあります。
また、クラス不均衡が大きいデータでは、ログロスだけを見るとモデルの問題を見落とすことがあります。たとえば、陽性が非常に少ないタスクでは、再現率や適合率も一緒に確認した方が安全です。確率の校正、つまり「80%と予測したものが実際にも約80%の頻度で起きているか」を見る視点も重要です。
| 観点 | 内容 |
|---|---|
| 利点 | 予測確率の質を評価でき、確率を使う意思決定と相性がよい |
| 注意点 | 極端な誤予測に敏感で、値の直感的な解釈がやや難しい |
| 併用したい指標 | 正答率、適合率、再現率、AUC、混同行列など |
| 実務上の確認 | 確率校正、クラス不均衡、外れ値の影響を確認する |
まとめ
対数損失は、分類モデルが出した予測確率の質を測る評価指標です。値は小さいほど良く、正解クラスに高い確率を置けているほど0に近づきます。
正答率が「最終的に当たったか」を見るのに対し、ログロスは「どれくらい適切な確率で予測したか」を見ます。そのため、確率をもとにリスク判定、優先順位づけ、追加確認の判断を行う場面では特に役立ちます。
ただし、対数損失だけでモデルを評価し切るのは避けましょう。タスクの目的に合わせて、正答率、適合率、再現率、AUC、混同行列なども併用すると、モデルの強みと弱みをより正確に把握できます。
更新履歴
| 日付 | 内容 |
|---|---|
| 2025年2月1日 | 初回公開 |
| 2026年6月9日 | 式の読み方と他指標との差分を補い、確率評価の観点を追記 |
