20260916-デバッグ評価-ThinkingOFF

LLMデバッグ担当を決め直すため、gpt-oss:120b と Qwen3.8(NVFP4・8bit)を、適切な設定と整えた依頼で測り直した記録です。Qwen3.8 bf16 は後日対応とし、今回は測っていません。

0. サマリ

ふゆきさんへ: 3モデルとも、正解はすべて「指摘なし」が答えの本で取ったもので、欠陥を見つけて正解した本はありません。成績だけで並べると 8bit、NVFP4、gpt-oss の順です。

モデル 正解 要検討 不正解 採点不能 見つけるべき欠陥8件の検出 作り直した4本の誤った指摘
Qwen3.8 8bit 4 2 4 1 部分的に1(ほかに一覧外の正しい指摘1) 2
Qwen3.8 NVFP4 4 1 5 1 0 0
gpt-oss:120b 4 0 6 1 0 4
モデル 作り直した4本の所要時間合計 最長の1本 必要だった出力枠 読み込み時のメモリ
Qwen3.8 8bit 約1,053秒 397.2秒(Alexa) 8,192 で全件書き切り(最大7,014トークン使用) サーバー使用約28.6GB、空き56%
Qwen3.8 NVFP4 約367秒 151.3秒(Alexa) 8,192 で全件書き切り(最大7,070トークン使用) 重み約18GB
gpt-oss:120b 約702秒 284.9秒(Alexa) 20,000 まで広げて全件書き切り(最大16,737トークン使用) 固定メモリ約66GB、空き12〜15%

1. LLM の設定

ふゆきさんへ: 本番の出力枠 4,096 は、整えた依頼に対して小さすぎます。特に gpt-oss は、このままでは今回の4本のどれにも回答を返せません。

1-1. 対象モデル
キー モデル 実行基盤 重みの大きさ
gptoss gpt-oss:120b Ollama(11434) 65,369,818,941 バイト
nvfp4 qwen3.8:27b-mlx(NVFP4) Ollama(11434) 18,174,721,847 バイト
q8 mlx-community/Qwen3.8-27B-8bit MLX mlx_lm.server(11436) 30,064,771,072 バイト
bf16 mlx-community/Qwen3.8-27B-bf16 MLX mlx_lm.server(11436) 54,760,833,024 バイト(今回対象外)
1-2. 本番の設定(2026-09-16 時点の実物)
1-3. 測定で使った設定
測定 モデル コンテキスト 出力枠 その他
元の7本 3モデル 32,768(8bit は MLX のため指定不可) 8,192 thinking off、temperature 0、top_p 1、各1回、判定マーカー指示なし
作り直した4本 NVFP4 65,536 8,192 本番と同じ判定マーカー指示あり、上限3600秒
作り直した4本 8bit MLX のため指定不可 8,192 同上
作り直した4本 gpt-oss 65,536 → 32,768 8,192 → 16,384 → 20,000 同上。本文が空・打ち切りのたびに広げた
1-4. 実測から分かった適切な設定

2. テスト項目

ふゆきさんへ: 過去に Codex が実際に投げたデバッグ依頼11本を使いました。そのうちコードも差分も無かった4本は、LLM が確かめようのない依頼だったため、当時のコードを貼って作り直しました。

2-1. 項目の選び方
2-2. 欠陥を見つける本
mox_law_v2
alexa_handoff_initial
mox_law_initial_retry(作り直し)
skm_phase5_compact_retry(作り直し)
alexa_weather_initial_retry(作り直し)
smartphone_axis_initial
2-3. 指摘なし・誤指摘しないことが答えの本
mox_law_v3
airscope_led_initial
airscope_led_review2
codex_control_same_turn_retry
every_golf_serigaya_recovery_retry(作り直し)
2-4. 評価から外した4本(コード無し)

3. テスト結果

ふゆきさんへ: 判定は「正解・要検討・不正解・採点不能」の4つです。所要時間は回答1本の実時間で、各モデルの最初の1本はモデルの読み込み時間を含みます(MLX は読み込み時間を分けて測れません)。

3-1. 判定の意味
3-2. 11本の判定と所要時間
テスト 答え gpt-oss NVFP4 8bit
mox_law_v2 欠陥2件 不正解 / 35.8秒 / 2,405 不正解 / 38.7秒 / 2,123 不正解 / 6.4秒 / 4
alexa_handoff_initial 欠陥1件 不正解 / 28.4秒 / 1,526 不正解 / 45.6秒 / 1,921 不正解 / 75.5秒 / 1,225
mox_law_initial_retry 欠陥3件 不正解 / 144.0秒 / 6,596 不正解 / 38.3秒 / 41 不正解 / 161.3秒 / 2,706
skm_phase5_compact_retry 欠陥1件 不正解 / 184.8秒 / 7,721 不正解 / 115.8秒 / 3,772 不正解 / 393.6秒 / 6,611
alexa_weather_initial_retry 欠陥1件 不正解 / 284.9秒 / 16,737 不正解 / 151.3秒 / 7,070 要検討 / 397.2秒 / 7,014
smartphone_axis_initial 不明 採点不能 / 66.3秒 / 4,631 採点不能 / 34.5秒 / 1,846 採点不能 / 90.5秒 / 1,813
mox_law_v3 指摘なし 正解 / 9.2秒 / 608 正解 / 7.3秒 / 283 正解 / 2.3秒 / 4
airscope_led_review2 OK 正解 / 8.8秒 / 585 正解 / 5.1秒 / 175 正解 / 12.3秒 / 211
every_golf_serigaya_recovery_retry 欠陥なし 正解 / 87.8秒 / 5,209 正解 / 62.2秒 / 2,113 正解 / 100.8秒 / 1,451
airscope_led_initial 誤BLOCKERなし 不正解 / 35.3秒 / 2,455 正解 / 8.5秒 / 289 正解 / 30.1秒 / 559
codex_control_same_turn_retry 追加指摘なし 正解 / 53.3秒 / 3,649 要検討 / 39.6秒 / 2,207 要検討 / 339.1秒 / 6,800

表の値は「判定 / 所要時間 / 出力トークン数」です。

3-3. 各モデルの回答の中身(要点)
gpt-oss:120b
Qwen3.8 NVFP4
Qwen3.8 8bit

4. Claude による各モデルの評価

ふゆきさんへ: どのモデルも、見つけるべき欠陥8件のうち完全に挙げたものは0件です。単独でデバッグを任せられる水準には届いていません。

1位 Qwen3.8 8bit
2位 Qwen3.8 NVFP4
3位 gpt-oss:120b
重み付けで変わる点

5. テスト運営の問題と、Claude の不手際で失った時間

ふゆきさんへ: 前任セッションと今回のセッションで、Claude の不手際によりふゆきさんをお待たせし、測定をやり直しました。

5-1. 前任セッション(2026-09-16 日中、引き継ぎ書第5章より)
5-2. 今回のセッション(2026-09-16 夜〜17)

6. 依頼文の品質について分かったこと

ふゆきさんへ: 過去11本のうち4本はコードも差分も無く、ルール正本の7項目を満たす依頼は1本もありませんでした。

7. 本番設定との差と影響

ふゆきさんへ: 今の本番設定のままでは、整えた依頼に対して gpt-oss の回答は返りません。

8. 採点基準と、この評価の限界

9. 未実施の項目と次回への申し送り

10. 再現手順と後片付け

ふゆきさんへ: 同じ条件で測り直すための手順と、後片付けのビフォア・アフターは、リポジトリ内の2つの資料にまとめました。

10-1. 後片付けの要点
対象 ビフォア アフター
11434 Ollama PID 1167、モデル読み込みなし PID 1167、モデル読み込みなし
11435 Alexa PID 869 PID 869(操作なし)
11436 MLX 中央キュー配下の bf16 サーバー PID 67454 が待ち受け 待ち受けなし。中央キューが次の依頼で自分で立ち上げ直す
codex_control_lab HEAD 97ca15f9、出力枠などの設定値 HEAD・設定値とも同じ(未コミット変更は測定前の09-15から存在)
mox_system 製品コード セッション開始時の変更状態 同じ(今回の変更なし)

リビジョン #3
作成: 2026-09-17 05:14:51 UTC (TRONS-冬木)
更新: 2026-09-17 06:47:09 UTC (TRONS-冬木)