この記事でわかること
- 中央値や上側90%点を回帰で予測する手順(Excel対応)
- ピンボール損失の意味とソルバーの設定
- 最小二乗法では見落とす「ばらつきの広がり」の捉え方
- 予測区間との違いと使い分け
📌 前提知識:回帰分析のやり方と結果の見方を読んでいると理解しやすくなります
切削速度を上げて加工時間を詰めたい、という検討をしています。速度を上げると表面粗さが悪化するはずなので、実験データを取って回帰分析にかけました。
結果は良好でした。速度160 m/minでも粗さの予測値はRy 4.19 μm。規格上限の5.0 μmに対して余裕があります。これなら行ける、と報告しかけました。
ところが実測値を眺めると、160 m/minの3点のうち1つがRy 5.8 μmです。すでに規格を超えています。回帰直線は平均を通るので、この点は「平均より上にばらついただけ」として処理されていました。品質管理で困るのは平均ではなく、上に外れた側です。
分位点回帰を使う場面
分位点回帰は、平均のかわりに中央値や上側90%点といった分位点を予測する回帰です。次の3つの場面で効きます。
- 片側の規格だけが問題になるとき。表面粗さ、不純物濃度、消費電力のように「上に外れたら不良」という特性が該当します
- ばらつきの大きさがxによって変わるとき。条件を厳しくするほど品質が安定しなくなる工程では、平均だけ見ても実態がつかめません
- 外れ値に結論を振り回されたくないとき。中央値回帰は極端な値の影響を受けにくく、外れ値の検出で除くか迷う点がある場合の代替として使えます
NG例(△)として、データ数が少ないときに端の分位点を推定するのは避けてください。上側90%点を求めるなら、その上側に何点か残っている必要があります。目安として、n=12で上側10%にあたるのは1.2点しかなく、推定はかなり不安定です。
何を最小化しているか|ピンボール損失
最小二乗法は残差の2乗和を最小にします。2乗すると上下の外れ方が同じ重みになるため、求まるのは平均の回帰です。平均・中央値・最頻値の関係と同じで、基準を変えれば別の代表値が出てきます。
分位点回帰では、残差 \( u \) に対して次の損失を使います。ピンボール損失、またはチェック関数と呼ばれます。
\[ \rho_\tau(u) = \begin{cases} \tau\,u & (u \ge 0) \\ (\tau-1)\,u & (u < 0) \end{cases} \]
\( \tau \) は求めたい分位点です。0.5なら中央値、0.9なら上側90%点を意味します。式の形は単純で、正の残差と負の残差に別々の重みをかけているだけです。\( \tau = 0.9 \) なら、線より上に外れた点には0.9、下に外れた点には0.1の重みがかかります。上に外れることを9倍きらうので、直線は自然と上へ引き寄せられます。
Excelでは場合分けをMAX関数1つで書けます。2つの式のうち大きいほうが必ず正しい側になるためです。
=MAX($G$1*D2,($G$1-1)*D2) ← G1にτ、D2に残差
\( \tau = 0.5 \) を入れると両方の重みが0.5で等しくなり、残差の絶対値の和(の半分)を最小にする形です。これが中央値回帰です。パーセント点とCDFで扱った分位点の考え方を、xごとに動く直線に拡張したものだと捉えてください。
例題|切削速度と表面粗さ
アルミ部品の外周旋削で、切削速度を4水準、各3回測定しました。yは表面粗さRy(μm)、規格上限は5.0 μmです。
| 切削速度 x(m/min) | Ry の実測値(μm) | この条件の平均 |
|---|---|---|
| 100 | 3.0 / 3.2 / 3.4 | 3.200 |
| 120 | 3.1 / 3.4 / 3.9 | 3.467 |
| 140 | 3.0 / 3.6 / 4.6 | 3.733 |
| 160 | 3.2 / 3.8 / 5.8 | 4.267 |
各条件の最小値は3.0、3.1、3.0、3.2とほとんど動きません。ところが最大値は3.4、3.9、4.6、5.8と急に伸びています。速度を上げても「うまくいったとき」の粗さは変わらず、悪いほうへのばらつきだけが広がるという形です。箱ひげ図を描くと、箱が右へ行くほど縦に伸びる様子が見えます。
まず通常の最小二乗法を当てます。
=SLOPE(B2:B13,A2:A13) → 0.017333 =INTERCEPT(B2:B13,A2:A13) → 1.413333
回帰式は \( \hat{y} = 1.413333 + 0.017333x \) です。速度160での予測は次のとおりです。
=1.413333+0.017333*160 → 4.1867
規格5.0 μmまで0.81 μmの余裕がある、という読みでした。冒頭の報告はここで止まっています。
Excelのソルバーで分位点回帰を解く
分位点回帰に対応する関数はExcelにありません。ソルバーで損失の合計を最小化します。手順はロジスティック回帰と同じ流れです。
シートの組み方は次のとおりです。
- A列にx、B列にy(2行目から13行目)
- E1に切片、E2に傾きの入れ物を作る。初期値はどちらも0でかまいません
- G1に \( \tau \)(今回は0.9)
- C2に予測値、D2に残差、F2に損失を入れて13行目までコピー
- F14に損失の合計
C2: =$E$1+$E$2*A2 D2: =B2-C2 F2: =MAX($G$1*D2,($G$1-1)*D2) F14: =SUM(F2:F13)
ソルバーは目的セルをF14、目標値を「最小値」、変数セルをE1:E2、解決方法は「GRG 非線形」に設定して実行します。制約条件はありません。
ピンボール損失は折れ線なので微分できない点があり、初期値によっては途中で止まることがあります。答えが怪しいときは初期値を最小二乗法の結果に変えて回し直してください。より確実なのは、残差を正の部分と負の部分に分けて変数を増やし、「シンプレックス LP」で解く組み方です。設定の手間は増えますが線形計画になるため、必ず最適解に到達します。
\( \tau \) を変えて3回実行した結果です。
| 推定する分位点 | 切片 | 傾き |
|---|---|---|
| τ = 0.1(下側10%点) | 3.000 | 0.000 |
| τ = 0.5(中央値) | 2.200 | 0.010 |
| 最小二乗法(平均) | 1.413 | 0.017 |
| τ = 0.9(上側90%点) | −0.600 | 0.040 |
検算しておきます。τ = 0.5のとき、直線 \( y = 2.2 + 0.01x \) は各条件の中央値3.2、3.4、3.6、3.8をすべて通ります。残差の絶対値の和は5.4で、これが最小です。τ = 0.9のときは12点すべてが直線上または直線より下に来て、損失の合計は1.12です。
上側90%点で見ると結論が変わる
表の傾きを並べ直します。下側10%点は0.000、中央値は0.010、平均は0.017、上側90%点は0.040。同じデータなのに、どの分位点を見るかで傾きが0から0.040まで変わります。上側90%点の傾きは中央値の4倍、最小二乗法の2.3倍です。
これは「速度を上げても、うまく削れたときの粗さは悪化しない。悪化するのは失敗したときだけ」という現象を数値にしたものです。最小二乗法はこの2つを平均してしまうため、どちらの実態も表しません。
規格5.0 μmに当てはめます。
| 切削速度 | 平均の予測(最小二乗法) | 上側90%点の予測 |
|---|---|---|
| 100 m/min | 3.15 | 3.40 |
| 140 m/min | 3.84 | 5.00 |
| 160 m/min | 4.19 | 5.80 |
平均だけ見れば160 m/minでも4.19で問題なし。ところが上側90%点は140 m/minの時点ですでに規格5.0 μmに到達しています。160では5.80まで伸び、およそ1割の製品が規格を0.8 μm超える計算です。
速度の上限を決める判断は、平均で見るか上側で見るかで140と160に分かれます。不良を出さないことが目的なら、答えは140です。公差と標準偏差の関係で扱ったとおり、規格に効くのは中心ではなく裾の位置です。
使う前に知っておく注意点
1. 予測区間とは別物
「上側を知りたいなら予測区間でよいのでは」と思うかもしれません。両者は前提が違います。回帰分析の予測区間は、誤差の分散がxによらず一定で正規分布に従う、という仮定のもとで回帰直線の上下に対称な幅をつけます。今回のデータはばらつきがxとともに広がっているので、この仮定が成り立ちません。分位点回帰は分布の形を仮定せず、各分位点を直接推定します。残差分析で等分散性が崩れていたら、予測区間より分位点回帰のほうが素直です。
2. 小標本では端の分位点が安定しない
今回のτ = 0.9では、12点すべてが直線上か直線より下という解になりました。上側10%にあたる点が1.2個しかないためで、1点動けば直線が大きく動きます。端の分位点を推定するなら、各水準の繰り返しを増やしてください。中央値付近であれば、この不安定さはかなり小さくなります。
3. 分位点どうしが交差することがある
τごとに別々に推定するので、外挿した先でτ = 0.5の線がτ = 0.9の線を追い越すことが起こります。今回の例では、中央値の線 \( y = 2.2 + 0.01x \) と上側90%点の線 \( y = -0.6 + 0.04x \) が \( x = 93.3 \) で交わります。実験範囲の下端100 m/minのすぐ外側です。ここより遅い速度では「上側90%点が中央値より小さい」というあり得ない予測が出ます。外挿しないのが原則ですが、今回のように範囲のすぐ際で交わることもあるので、予測に使う前に交点を確かめてください。
よくある質問
Q. 上側90%点を知りたいだけなら、各水準の最大値を結べばよいのでは?
A. 水準ごとの繰り返しが十分にあれば近い結果が得られますが、2つ問題があります。1つは最大値が1点に依存するため、たまたま出た外れ値に直線が引きずられること。もう1つは水準の間の値を予測できないことです。分位点回帰は全データを使って1本の直線を当てるので、130 m/minのような未実施の条件も予測できます。
Q. 説明変数が複数あっても使えますか?
A. 使えます。予測値の式を重回帰の形に変えて、ソルバーの変数セルを係数の数だけ増やすだけです。損失の作り方は変わりません。ただし変数が増えるほどソルバーが局所解で止まりやすくなるので、最小二乗法の結果を初期値にしてください。係数の解釈は重回帰分析と同じで、他を固定したときの変化量です。
Q. 係数の有意性は判定できますか?
A. 分位点回帰の標準誤差には決まった簡単な式がなく、通常はブートストラップで求めます。データを復元抽出して何百回も推定し直し、係数のばらつきから信頼区間を作る方法です。Excelでも組めますが手間がかかるため、有意性まで踏み込むなら統計ソフトに移るほうが早いです。Excel統計の限界で扱った線引きのひとつです。
Q. 回帰の種類が増えてきて選べません。どう使い分けますか?
A. 目的変数の性質で決めます。連続量の平均を見るなら最小二乗法、2値の起こりやすさならロジスティック回帰、件数ならポアソン回帰、連続量でも平均ではなく特定の分位点を見たいなら分位点回帰です。分位点回帰だけは目的変数の型ではなく「分布のどこを見たいか」で選ぶ点が違います。
まとめ
- 分位点回帰は、残差の正負に別々の重みをかけるピンボール損失を最小化して分位点を推定する
- τ = 0.5なら中央値回帰、τ = 0.9なら上側90%点の回帰になる
- Excelには専用関数がないため、損失の合計をソルバーで最小化する
- 例題では傾きが下側10%点で0.000、中央値で0.010、平均で0.017、上側90%点で0.040。平均の予測は160 m/minで4.19と余裕があるが、上側90%点は140 m/minで規格5.0に到達する
- 等分散を仮定する予測区間とは別物。小標本では端の分位点が不安定になる
まとめると、工程の中心がどう動くかを知りたいなら最小二乗法、規格を外れる側がどう動くかを知りたいなら分位点回帰、という使い分けです。ばらつきが条件によって広がる工程では、平均だけを追うと安全側の判断になりません。
この記事の前提となる回帰分析の手順は回帰分析のやり方と結果の見方、ばらつきが一定かどうかの確認方法は回帰分析の前提条件と残差分析で解説しています。あわせてご確認ください。

