画像入力の検証記録
September 21, 2026 · View on GitHub
2026-09-19のLFMローカル測定です。Jev本体の評価や一般的なモデル精度を示すものではありません。入力画像・生ログ・応答JSONはGit管理対象外とし、このページには条件と要約だけを掲載します。
後日のSarashina画像経路修正・同じGSS資料の評価は別ページです。元画像1190×665で12/12、512×286への縮小で9/12となり、画像サイズとモデルを混ぜて速度・精度を比較しないようにしています。
条件
- LFM2.5-VL-1.6B Q8_0、画像エンコーダーmmproj F16、llama.cpp b11042。
- GSS資料の画像を512×286 pxに縮小。入力画像SHA256:
e7fe438ae2791a2f07718bb213120bd6bc3a8bcb2ff8077550cfefc18328bff9。 - 質問:
vision_gss.jsonの12問、またはvision_gss_4.jsonの4問。想定回答はモデルへ渡していません。 - GPU: AMD Radeon AI PRO R9700 / ROCm。4 slots、CPUスレッド8、CTX_SIZE=32768。
- 時間はモデル常駐後のHTTPリクエスト開始からJSON応答完了まで。ファイル読み込みとbase64変換、モデルロードは含みません。
- Scoreは最大確率の段階、NoulはP(true)≧0.5、Choiceは選択された候補で想定回答との一致を判定します。Scoreの期待値を丸めて採点していません。
12問の読解確認
| 条件 | 想定回答との一致 | GPU応答時間 |
|---|---|---|
| 元の選択肢順・画像あり | 10/12 | 1.075秒 |
| 元の選択肢順・画像なし | 10/12 | 0.175秒 |
| Choiceの選択肢順を反転・画像あり | 8/12 | 1.011秒 |
| Choiceの選択肢順を反転・画像なし | 5/12 | 0.165秒 |
各条件1回の測定です。元のChoice 6問は想定正解がすべて先頭にあり、画像なしでも同じ10問が一致しました。元の10/12だけでは画像を読解できたと評価できません。 反転時には画像ありでVPN・検知日・総件数を正しく選べましたが、件数内訳・再発防止策は誤答へ変わり、選択肢の位置に対する感度が見られました。
「一般の方の個人情報」「マイナンバー等」が含まれるかという2問は、資料の「含まれていない」に反して「含まれる」と高い候補確率で誤答しました。候補確率や分布の集中度は正しさの保証になりません。画像は本文の文字が小さく、解像度が誤りの原因かどうかは未検証です。
CPUでも一致数・離散的な回答は同じでした。元の順序・画像ありは20.582秒でしたが、これは単発の参考値です。
4問の速度
侵入手段・検知日・総件数・赤い破線の意味の4問(Choice)に限定。公式GPUバイナリでウォームアップ1回を除いた5回の中央値は348 ms、範囲346〜362 msでした。全5回とも想定回答と一致しましたが、選択肢の位置に関する上記の制約は残ります。
12問の1.075秒と比べて約3.1倍高速ですが、質問構成と測定回数は異なります。並列数を変えて最適値を検証した測定ではありません。
画像エンコードキャッシュ
実験ビルド内で再利用を無効/有効に切り替え、無効→有効→有効→無効の順で実行。各ブロックは初回1回+5回、state共有は無効です。
| 条件 | 応答時間 | 回数 |
|---|---|---|
| 無効・初回 | 380〜383 ms | 2 |
| 有効・初回(各1 miss+3 hits) | 192〜212 ms | 2 |
| 無効・初回を除く中央値 | 358 ms | 10 |
| 有効・同じ画像を再送した中央値 | 98 ms | 10 |
初回は約1.9倍、再送時は約3.66倍高速でした。入力トークン合計1378・出力4トークンは同じで、decoder側のState共有は行っていません。4並列では全測定間の最大候補確率差が約0.0247あり、再利用無効でも揺れています。1ワーカーの追加比較では候補確率の差は0でした。回答選択はすべて同じです。
再現
画像は同梱していません。対応する画像を配置し、評価ツールのevaluate_vision_gss・benchmark_vision・benchmark_image_cacheを実行してください。結果と条件はresults/へJSONで保存されます。別の画像を使う場合、GSS固有の想定回答との一致数は比較に使えません。