LLM性能評価
20260916-デバッグ評価-ThinkingOFF
LLMデバッグ担当を決め直すため、gpt-oss:120b と Qwen3.8(NVFP4・8bit)を、適切な設定と整えた依頼で測り直した記録です。Qwen3.8 bf16 は後日対応とし、今...
20260916-デバッグ評価-ThinkingON
thinking OFF の測定(20260916-ThinkingOFF)と同じ11本を、thinking ON で測り直した記録です。コンテキストは各モデルの上限、出力枠は大きめにとりました...
20260916-デバッグ評価-Haiku
thinking OFF・thinking ON と同じ11本のデバッグ依頼を、Claude Haiku に回答させた参考記録です。ローカルの LLM とは呼び出し方も設定も揃えられていないため...
20260918-コーディング評価
0. ふゆきさん向けのまとめローカルLLMに実際のコミットと同じ実装を書かせ、テストと検収で合否を測りました。小さな変更ならローカルに任せられます。落ちる原因はコードの理解力ではなく、ファイル全...