画像入力の検証記録

September 21, 2026 · View on GitHub

2026-09-19のLFMローカル測定です。Jev本体の評価や一般的なモデル精度を示すものではありません。入力画像・生ログ・応答JSONはGit管理対象外とし、このページには条件と要約だけを掲載します。

後日のSarashina画像経路修正・同じGSS資料の評価は別ページです。元画像1190×665で12/12、512×286への縮小で9/12となり、画像サイズとモデルを混ぜて速度・精度を比較しないようにしています。

条件

  • LFM2.5-VL-1.6B Q8_0、画像エンコーダーmmproj F16、llama.cpp b11042。
  • GSS資料の画像を512×286 pxに縮小。入力画像SHA256: e7fe438ae2791a2f07718bb213120bd6bc3a8bcb2ff8077550cfefc18328bff9
  • 質問: vision_gss.jsonの12問、またはvision_gss_4.jsonの4問。想定回答はモデルへ渡していません。
  • GPU: AMD Radeon AI PRO R9700 / ROCm。4 slots、CPUスレッド8、CTX_SIZE=32768。
  • 時間はモデル常駐後のHTTPリクエスト開始からJSON応答完了まで。ファイル読み込みとbase64変換、モデルロードは含みません。
  • Scoreは最大確率の段階、NoulはP(true)≧0.5、Choiceは選択された候補で想定回答との一致を判定します。Scoreの期待値を丸めて採点していません。

12問の読解確認

条件想定回答との一致GPU応答時間
元の選択肢順・画像あり10/121.075秒
元の選択肢順・画像なし10/120.175秒
Choiceの選択肢順を反転・画像あり8/121.011秒
Choiceの選択肢順を反転・画像なし5/120.165秒

各条件1回の測定です。元のChoice 6問は想定正解がすべて先頭にあり、画像なしでも同じ10問が一致しました。元の10/12だけでは画像を読解できたと評価できません。 反転時には画像ありでVPN・検知日・総件数を正しく選べましたが、件数内訳・再発防止策は誤答へ変わり、選択肢の位置に対する感度が見られました。

「一般の方の個人情報」「マイナンバー等」が含まれるかという2問は、資料の「含まれていない」に反して「含まれる」と高い候補確率で誤答しました。候補確率や分布の集中度は正しさの保証になりません。画像は本文の文字が小さく、解像度が誤りの原因かどうかは未検証です。

CPUでも一致数・離散的な回答は同じでした。元の順序・画像ありは20.582秒でしたが、これは単発の参考値です。

4問の速度

侵入手段・検知日・総件数・赤い破線の意味の4問(Choice)に限定。公式GPUバイナリでウォームアップ1回を除いた5回の中央値は348 ms、範囲346〜362 msでした。全5回とも想定回答と一致しましたが、選択肢の位置に関する上記の制約は残ります。

12問の1.075秒と比べて約3.1倍高速ですが、質問構成と測定回数は異なります。並列数を変えて最適値を検証した測定ではありません。

画像エンコードキャッシュ

実験ビルド内で再利用を無効/有効に切り替え、無効→有効→有効→無効の順で実行。各ブロックは初回1回+5回、state共有は無効です。

条件応答時間回数
無効・初回380〜383 ms2
有効・初回(各1 miss+3 hits)192〜212 ms2
無効・初回を除く中央値358 ms10
有効・同じ画像を再送した中央値98 ms10

初回は約1.9倍、再送時は約3.66倍高速でした。入力トークン合計1378・出力4トークンは同じで、decoder側のState共有は行っていません。4並列では全測定間の最大候補確率差が約0.0247あり、再利用無効でも揺れています。1ワーカーの追加比較では候補確率の差は0でした。回答選択はすべて同じです。

再現

画像は同梱していません。対応する画像を配置し、評価ツールevaluate_vision_gssbenchmark_visionbenchmark_image_cacheを実行してください。結果と条件はresults/へJSONで保存されます。別の画像を使う場合、GSS固有の想定回答との一致数は比較に使えません。