2013年に慰謝料の予測機を作った話

2013年に、不貞の慰謝料がいくら認められそうかを予測する小さな道具を作った。所内で使うために作ったもので、いまも使っている。名前は「むじんくん」という。生成AIがこれだけ話題になるよりずっと前のことだ。

なぜ作ったか。相談に来る人が本当に知りたいのは、条文の解釈ではなく「結局いくらになるのか」「それだけの価値があるのか」だ。弁護士の側から見ると、慰謝料の相場は経験でだいたい分かる。ただ、その「だいたい」は人によってぶれるし、根拠を聞かれると裁判例をいくつか思い出して答えるくらいで、それ以上の説明がしにくい。法律サービスは、お金を払う前に中身の良し悪しを判断しにくい(経済学でいう信用財に近い)。見通しが立たないと、人は「何もしない」を選ぶ。僕はこの「何もしない」がいちばん大きな相手だと思っている。だったら、見通しを数字で出す機械があればいい。動機はそれだけで、いまも変わっていない。

予測といっても、正しい額を教えてくれるものではない。裁判官がこれまでどう判断してきたかを集めて、その傾向を写しているだけだ。だから、出てくる数字は「過去の裁判官の判断の集約」であって、「この事件で認められるべき正しい額」ではない。この区別は、この道具を語るときにいつも最初に言うことにしている。材料にできるのは訴訟まで行った事件だけなので、訴訟にならずに終わった事件の相場は入っていないし、件数も多くはない。偏りがある前提で使う。

当時、どこまで当たっていたか。手元の記録で言えるのは、後に修士論文に載せた小さなテストの数字だけだ。6件の事件について、道具の予測と、所内の弁護士の予測を、実際の認容額と比べた。実際の額から50万円以内に収まった割合は、道具が83.3%(6件中5件)、弁護士は人によって33%から67%だった。ただ、6件だ。5件当たるか4件当たるかの差でしかないので、これで機械が弁護士より当たるとは言わない。言えるのは、この程度の道具でも、相談の場で「見通し」として出せる水準にはあった、ということくらいだ。これは僕の評価で、6件の数字から言える範囲はそこまでだと思っている。

2021年度に、大学院の修士論文としてこれを測り直した。判決300件を自分で集めて、認容額に関係しそうな事情(婚姻期間や不貞の期間、子どもの有無といった項目)を一件ずつ読み取ってラベルにし、リッジ回帰(説明変数が多くても係数が暴れにくいようにした線形回帰)で認容額を予測させた。条件を並べておく。データは自作の300件で、訴訟に至った事件だけ。判決の時期は1975年から2020年で、2008年以前が100件、2016年から2020年が200件という二層になっている(間の時期は入っていない)。テストは時期の新しい2割で、古い8割で学習して新しい2割を当てる。認容額が特に大きい少数の事件を除いた組で、実際の額から50万円以内に収まった割合が79.7%、100万円以内が94.9%、誤差の大きさをひとつの数にまとめたもの(RMSE)で47万円だった。

100万円以内なら95%、50万円以内なら8割。相談の場で「だいたいこのくらい」と言うための道具としては使える数字だと僕は思う。ただ、テストに使えた件数は多くない。ラベルは自分で読んで付けたものなので、読み方の癖もそのまま入っている。

ここからが、いま書きたかった話だ。2026年に、同じ300件で全部やり直すことにした。今度は、事情の読み取りを人の手ではなくAI(大規模言語モデル)にやらせて、どこまで精度が上がるのか、上がらないなら何が効いているのかを測る。その準備で、昔の自分の作業を一件ずつ確かめることになった。

まず、300件のうち49件は、判決の本文が手元に十分な形で残っていなかった(当時は判決の本文ではなく、判例集や書籍の記載だけを見て事情を読み取った件がある)。判例データベースで探し直して、44件は全文を取り直せた。5件は見つからなかった。うち2件は要旨しか載っておらず、3件はデータベースに該当する事件が出てこない(裁判所に判決がないという意味ではない)。この5件は差し替えずに、そのまま「本文なし」として持つ。

次に、取り直した本文の主文と、自分が記録していた「認容額」を12件で突き合わせた。すると10件では、記録していたのは主文の合計額ではなく慰謝料の本体の額だった(主文が300万円で、その内訳が慰謝料270万円と弁護士費用30万円なら、270のほう)。自分の記憶では主文の額を入れていたつもりだったので、逆だった。そして2件は、額そのものが間違っていた。1件は請求が棄却されていたのに、請求額のほうを認容額として記録していた。もう1件は、判決の理由の中に出てくる評価額を、最終的な認容額と取り違えていた。

12件のうち2件。母数が小さいので、300件全体でどのくらい間違っているのかはまだ分からない(残りは、AIに本文から額を読み取らせて元の記録と突き合わせるつもりで、その誤り率そのものを一つの結果として出す)。元の値は書き換えない。再現のためには当時の値が要るし、黙って直すと、何がどう間違っていたかが後から分からなくなる。訂正した値は別の列に、出所(どの判決のどの記述か)を付けて持つ。

正直に言えば、自分が作って測ってきたデータの中に、自分の手作業の誤りが混じっていたことになる。それでも予測が実務の見通しとして役に立ってきたのは、慰謝料の額が個々の事情にそれほど敏感ではなく、多少のノイズがあっても傾向は取れる、ということなのだろう。これは仮説で、今回の再実行で確かめる。数字が前より悪くなる可能性もある。それならそれで、条件と一緒にそのまま出す。

2013年に作ったときの気持ちは、要するに、相談に来た人に見通しを渡したい、それだけだった。いま同じ300件をもう一度やり直しているのは、その道具がどこまで信用できるものなのかを、僕の記憶ではなく、誰でも確かめられる形で出しておきたいからだ。作り方の細かい話(当時どう作って、どこを直してきたか)は、記録を確かめてから別に書く。まず数字と、見つかった誤りから書いておく。