荷物や棚の写真、入出荷時の帳票を確認したり、設備の点検画像から報告書を作成したりする作業には、担当者による目視確認や入力作業の工数がかかります。
そこで、近年は画像を扱えるLLM(大規模言語モデル)を活用し、写真の説明、帳票項目の抽出、確認メモの下書きなどを支援する方法が注目されています。
ただし、LLMによる画像認識は、従来の画像認識AIをそのまま置き換える技術ではありません。画像の状況を文章で整理したり、質問に答えたりする業務に向く一方、傷の有無を高い精度で判定する、対象を正確に数えるといった工程では、人による確認と組み合わせるケースもあります。
本記事では、LLMが画像を扱う仕組みや従来AIとの違い、メリット、導入手順を解説します。
LLMの画像認識とは画像・テキスト情報を統合して理解・処理する技術のこと

LLMによる画像認識とは、画像とテキストの指示を一緒に入力し、画像の内容を自然な文章で説明したり、質問に答えたり、必要な項目を取り出したりする技術です。
LLMの画像認識は、画像に写っているものを判別するだけではありません。例えば、在庫を保管する棚の写真をLLMに入力し、次のように指示すると、回答を得られます。
「空いている棚番と、補充が必要そうな場所を箇条書きで示してください」
《生成内容(回答例)》
・空いている棚番:A-03、B-12
・補充が必要そうな場所:C-05(在庫が少ない可能性)
写真と指示を結び付けて状況を推論し、回答を生成する仕組みです。
画像を理解して回答を生成するマルチモーダルLLM
上述のように、画像の内容を読み取り、テキストの指示に応じて回答を生成できるLLMは、マルチモーダルLLMの一種です。マルチモーダルLLMとは、テキスト・画像・音声・動画など複数形式の情報を扱えるLLMを指します。なかでも、視覚情報(Vision)と言語(Language)を扱うモデルは、VLM(Vision Language Model)とも呼ばれます。
実務では、画像対応のLLMやVLMを使って、写真・PDF・スクリーンショットを読み取り、次のような出力を得るイメージです。
| 入力するもの | LLMに依頼すること | 出力の例 |
|---|---|---|
| 荷物や棚の写真 | 状況を説明する、確認点を挙げる | 確認メモ、チェックリスト案 |
| 設備の点検画像と点検基準 | 基準に沿って見比べる | 確認が必要な箇所、報告書の下書き |
| 帳票画像・PDF | 指定項目を抜き出す | 日付、伝票番号、数量の一覧 |
| 図面や資料のスクリーンショット | 内容を要約し、質問に答える | 要点、追加確認事項 |
LLMの回答は、入力する画像の明るさ・解像度・写り方や、指示の具体性によって変わります。画像にない情報をもっともらしく補うこともあるため、品質判定や出荷判断をLLMだけで確定させることは適切ではありません。
まずは、人が確認する前の情報整理や報告書の下書きなど、最終判断を任せない工程から試すとよいでしょう。
LLMが画像を認識する基本的な仕組み
LLMが画像を認識する際は、まず画像エンコーダーという仕組みが画像を小さな断片に分け、色・形・配置などの特徴をモデルが扱える数値情報に変換します。
次に、視覚情報と言語情報をつなげる「アダプターモジュール」が、画像側の数値から重要な情報を抽出し、言語モデルが扱える形式につなぎます。
LLMは、この画像情報と「何を確認するか」というプロンプト(指示文)を関連付け、説明文や抽出結果を生成する仕組みです。
従来の画像認識AIとの違い
従来の画像認識AIは、画像分類や物体検出、OCR(画像内の文字を読み取る技術)など、目的を定めた処理に合わせて作られることが一般的です。一方、マルチモーダルLLMによる画像認識は、画像と自然言語を組み合わせ、説明・質問への応答・要約・項目抽出などを柔軟に試せます。
《マルチモーダルLLMと従来の画像認識AIにおける違い》
| 比較項目 | マルチモーダルLLMによる画像認識 | 従来の画像認識AI |
|---|---|---|
| 得意な処理 | 画像の説明、質問応答、内容の要約、文書や図表からの項目抽出 | 分類、物体検出、文字認識、数のカウントなど、目的が明確な処理 |
| 理解できる内容 | 写っている物だけでなく、画像全体の状況や物同士の関係も踏まえて説明できる | 「犬」「車」など、あらかじめ定めた対象の検出・判定が中心 |
| 出力形式 | 文章、箇条書き、表、指定した形式のデータなど | 判定した対象名、位置情報、信頼度、読み取った文字など |
| 柔軟性 | 指示文を変えることで、複数の作業を試しやすい | 新しい目的に対応するには、設計や学習データの見直しが必要になりやすい |
| 処理速度 | モデルや指示の内容により変わる(詳しい説明や複数の確認を行う場合は、時間がかかることがある) | 軽量な専用モデルでは、リアルタイム処理に向く場合がある |
| 向く業務 | 写真の確認メモ、帳票の整理、画像についての質問対応、報告書の下書き | 外観検査、対象物の検出、通過数の計測、定型的なOCR |
重要なのは、どちらが優れているかではなく、目的に合わせて使い分けることです。例えば、画像認識AIで「パレット」や「作業員」を検出し、その検出結果と写真をマルチモーダルLLMに渡して「安全確認の報告文」を作る、といった組み合わせも考えられます。
数や位置を正確に扱う工程は画像認識AI、人が読むための説明や確認事項の整理はマルチモーダルLLM、という役割分担が選択肢になります。
LLMによる画像認識のメリット

マルチモーダルLLMを活用すると、画像内の情報を読み取るだけでなく、内容を文章で整理したり、指示に応じた回答を生成したりできます。
ここでは、業務で活用する際の主なメリットを3つ解説します。
メリット1:画像の文脈を踏まえて説明・質問応答できる
LLMは、画像内の対象物の有無だけでなく、複数の要素・文字・配置を関連付けて文章に整理できます。例えば工場設備の写真と点検基準を入力し、「点検基準と見比べて、担当者が確認すべき箇所を挙げてください」と依頼することも可能です。
このような使い方をする場合、AIの役割は異常の最終判定ではなく、確認観点を文章化して提示することです。担当者はAIが作成した下書きを確認し、写真の見直しや現場確認、最終判断をおこないます。そのため、写真を見比べて確認メモを作る作業や、報告書のたたき台を作る時間を減らせる可能性があります。
メリット2:プロンプトを変えて複数のタスクを試しやすい
同じ棚の写真でも、LLMへの指示を変えることで複数の目的に活用可能です。例えば「写真を説明してください」「空き棚を確認してください」「作業者に確認してほしい点を3つ挙げてください」のように、目的に合わせて依頼内容を変えられます。
例を与えず指示だけで実行する方法をZero-shot(ゼロショット)、少数の入力例と期待する出力例を示して回答の形を整える方法をFew-shot(フューショット)といいます。まずは指示だけで実行し、出力の粒度がそろわない場合は、良い出力例を2〜3件添える方法がよいでしょう。
用途ごとに専用モデルを構築するのではなく、既存の画像対応LLMを用いて、プロンプトと出力例を変えながら業務との相性を確認できる点がメリットです。ただし、LLMの精度や出力内容が業務に求められる正確さに届くかは、実際の画像で評価する必要があります。
メリット3:専用モデルを構築する前に小規模なPoCを始めやすい
画像認識に対応したLLMをAPI(外部のAI機能を自社のシステムから呼び出す窓口)で利用すれば、モデルを最初から開発・運用せずに、現場での実現可能性を確かめられる場合があります。
例えば、既存の設備点検写真を20〜50枚程度選び、各写真について担当者が作成した確認メモを用意します。写真と確認メモをLLMに渡し、出力されたメモが担当者の確認を助ける内容か、見逃してはいけない項目を外していないかを比較しましょう。
ここで確認すべきなのは、単に「回答できたか」ではなく、次のようなポイントを見ます。
- 確認メモの作成時間が短くなるか
- 手直しの量はどの程度か
- 画像ごとに回答がばらつかないか
- 重大な見逃しがないか
PoCは、専用モデルの開発や大規模なシステム導入に進む前に、用途との相性と必要な精度を見極める機会になります。
LLMを使った画像認識を導入する手順

ここでは、LLMを使った画像認識の技術を実務へ導入する手順について、5つのステップで整理します。
ステップ1:PoCの対象にする画像と業務を決める
まずは、実行したい業務を1つ選び、その中で画像認識に使用する画像の種類を1つに絞ります。例えば「入荷時の帳票画像から伝票番号・日付・数量を抽出する」「棚の写真から担当者向け確認メモを作る」といった粒度です。
対象を広げすぎると、画像の種類や正解の基準が混ざり、出力に対して「何が原因で結果が悪いのか」を判断しにくくなります。
そのため、実際に発生している作業の中から、実際の結果を人が判断できる工程を選びましょう。
ステップ2:API利用か自社環境での実行かを決める
導入方法は、大きく分けると次の2種類があります
- 画像対応LLMのAPIを使う方法
- オープンソースのモデルを自社環境で動かす方法
それぞれの特徴を表にまとめました。
| 方法 | 向いている場面 | 事前に確認すること |
|---|---|---|
| API利用 | まず小規模に試したい、サーバーやモデルの管理を抑えたい場合 | 利用料金、既存システムへの組み込み方、試したい業務・画像の範囲 |
| 自社環境での実行 | 外部APIを利用できない事情がある、モデルを細かく調整したい場合 | 高性能なサーバー、構築・保守を担う人、モデルの利用条件 |
APIはLLMを使った画像認識の方法として始めやすい一方、画像に含まれる情報を外部サービスへ送ることになります。図面や工場内の写真、顧客帳票などを扱う場合は、データの保存先や利用条件、社内ルールを先に確認してください。
自社環境での実行は、外部サービスへの画像送信を避けたい場合の選択肢になります。ただし、高性能な計算機の用意や、構築・保守を担う体制が必要です。
ステップ3:プロンプトと期待する出力を決める
プロンプトには、「誰のために」「何を」「どの基準で」「どの形式で」出力するかを具体的に書きます。曖昧な指示よりも、出力項目を固定したほうが比較・評価しやすくなります。
例えば、次のような指示です。
この棚の写真を確認し、
1. 確認できた棚番
2. 空きスペースの有無
3. 画像だけでは判断できず現場確認が必要な点
を、各項目を箇条書きで出力してください。画像に写っていない内容は推測せず、「判断できない」と記載してください。
マルチモーダルLLMを業務で活用するには、「画像から何を確認したいか」をプロンプトで明確にし、結果をどのような形式で受け取りたいかを決めることが重要です。確認項目や出力形式をあらかじめそろえることで、回答を比較・評価しやすくなります。
ステップ4:PoCで精度と運用条件を確認する
実際に業務で使う画像を用いて、期待する説明・回答・抽出結果が得られるかを確認します。このとき、正答率だけではなく、業務への影響が大きい誤りも記録することが大切です。
《よくある出力内容の誤り》
- 見逃し:確認すべき情報が出力されない
- 過検出:問題がないのに要確認と出力される
- 読み取りミス:帳票の数値や項目を誤って読む
- 項目の取り違え:別の欄の値を対象項目として出力する
- 画像にない情報の生成:写真に写っていない内容を断定する
あわせて、APIを利用する場合は、利用量に応じた料金や応答にかかる時間を確認します。自社環境で実行する場合は、高性能なGPUなどの計算資源、構築・保守を担う体制を確認しましょう。
ステップ5:人間の確認工程を含めて運用方法を決める
マルチモーダルLLMの出力は、あくまで担当者の確認を支援するためのものです。誤った読み取りや、画像だけでは判断できない内容が含まれる可能性があるため、最終判断までAIに任せない運用を決める必要があります。
そこで、AIが一次整理をおこない、担当者が画像と出力を確認し、必要に応じて責任者が承認する流れを決めます。
運用を決める際は、次の点を明確にしましょう。
- AIが作成する情報:画像説明、項目抽出、確認メモの下書き
- 担当者が確認する内容:画像との一致、数値、例外の有無
- 最終判断者:出荷・品質・設備に関する承認をおこなう人
- エスカレーション条件:画像が不鮮明、回答が不確か、重要項目が欠けた場合など
この役割分担をPoCの段階で決めておくと、本番利用で「誰もAIの回答を確認していなかった」という状態を避けやすくなります。その結果、確認漏れや誤った判断のリスクを抑えながら、写真の確認や報告書作成にかかる担当者の負担を減らせます。
LLMによる画像認識の活用例

ここでは、LLMを使った画像認識技術の活用例を紹介します。
画像の内容を説明文やレポート案にする
画像の内容を自然言語で説明する処理は、画像キャプション生成と呼ばれます。現場写真や製品画像を入力し、何が写っているか、どのような状態かを説明文として出力します。
例えば、荷崩れの確認が必要な写真を入力し、LLMに「写っている荷物の状態と、担当者が確認すべき点を分けて記載して」と指示します。出力した文章は、確認メモや日報の下書きに利用できます。
こにより、担当者はゼロから文章を作る代わりに、画像と下書きの一致を確認して修正する作業に集中できます。なお、最終的な状況判断は、人が写真や現場を確認しておこなう必要があります。
画像に対して質問し、必要な情報を取り出す
VQA(Visual Question Answering)とは、画像に対して自然言語で質問し、画像の内容に基づく回答を得る技術です。画像全体の説明ではなく、知りたい情報に絞って確認できる点が特徴です。
例えば、設備写真に「安全表示は確認できますか」「床面に障害物が写っていますか。判断できない場合はその理由も示してください」と質問します。写真を見る担当者は、必要な確認項目を探す前に、AIが提示した回答と根拠を確認できます。
ただし、写真の死角や解像度不足で確認できない事項もあるため、回答を現場の事実として扱わず、参考情報として留めることが大切です。
帳票・図表・資料画像から情報を読み取る
帳票や図表を業務で取り扱う際は、文字を読み取るだけでなく、「どの項目にどの値が対応するか」を整理するケースが多いです。このとき、LLMによる画像認識を用いると、帳票画像・表・グラフを入力し、必要な項目の抽出、内容の要約、質問への回答出力をおこなえます。
OCRが主に文字情報を抽出するのに対し、画像対応LLMは、帳票内の見出しと値の関係、表の並び、質問の意図を踏まえて結果をまとめられる場合があります。
例えば、入出荷帳票から「伝票番号、日付、数量、品番」を表形式で抽出し、担当者が元帳票と照合して登録する流れです。なお、数値や品番の誤読は後工程に影響するため、登録前の人による照合は残す必要があります。
製造・小売などの業務画像の確認を支援する
LLMを使った画像認識の活用シーンとして、製造業では製品・検査画像、小売業では商品棚の画像を使い、担当者が確認すべき情報を整理する用途が考えられます。製造では傷や汚れの可能性がある場所、小売では欠品や陳列状態の確認点を文章で挙げる、といった使い方です。
LLMは、画像の説明や質問に応じた確認事項の整理に対応します。一方、傷の見逃しを防ぐ、在庫数を正確に確定するといった精度要求の高い工程では、専門の画像認識AIや人による確認、既存の検査システムを組み合わせることを検討しましょう。
LLMによる画像認識を活用する際の注意点

マルチモーダルLLMは画像をもとにした確認や文書作成を支援できますが、出力内容が常に正しいとは限りません。業務で活用する際は、判断の任せ方や情報の扱い方をあらかじめ決めた上で、注意点を押さえておくことが重要です。
ここでは、LLMによる画像認識を導入する上での注意点を解説します。
画像品質が低いと認識精度が下がる
暗い、ぶれている、対象が小さい、影や反射がある画像では、LLMが対象の特徴や文字を正しく読み取れないことがあります。検査が必要な写真なら見逃しや過検出、帳票なら数値の読み違いにつながる可能性があります。
対策として、PoCの前に撮影角度や照明、距離、解像度、画像に収める対象範囲を決めてください。加えて、再撮影が必要な条件も定めると、入力画像のばらつきを抑えやすくなります。
使用するAIの選定だけではなく、安定した画像を用意できるかも画像認識の精度に影響します。
期待する出力が曖昧だと評価できない
LLMに指示する際、「画像の中に異常があるか確認して」と入力するだけでは、AIがどの観点で何を返すべきか定まりません。これだと、回答の粒度がそろわず、PoCで良し悪しを評価しにくくなります。
そのため、指示を入力する際は「確認すべき箇所」「確認理由」「画像だけでは判断できない事項」のように、出力項目を指定してください。
さらに、許容できないエラー、確認者、後工程での使い方をPoC前に決めましょう。何をもって「有効な出力内容である」と判断するかを先に決めることが、LLMによる回答を次の判断につなげるポイントです。
ハルシネーションや誤認識を前提に精度評価する
LLMは、画像に写っていない内容を説明したり、細部や位置関係を誤って捉えたりすることがあります。このような事実に基づかない生成は、ハルシネーションと呼ばれます。
評価時は「精度が低い」と一括りにせず、見逃しや過検出、読み取りミス、項目の取り違え、画像にない情報の生成に分けて記録します。特に、見逃しがどの業務上の事故や手戻りにつながるかを確認してください。
回答のばらつきも、同じ画像と指示で複数回試して確認し、業務上重大な問題がないかを判断するとよいでしょう。
最終判断は人間がおこなう体制にする
LLMの出力を、そのまま品質判定や出荷判断、設備停止判断に使うと、誤認識による影響が大きくなるおそれがあります。最初は、下書きや情報の一次整理、確認観点の提示などに用途を限ることが現実的です。
LLMによる画像認識を導入する際は、事前に次の条件を決めておきましょう。
- AIが示す情報の内容・粒度
- 担当者が確認する内容
- 承認者
- 判断を引き継ぐ場合
機密情報や個人情報を含む画像の扱いに注意する
図面や工場内画像、製品写真、顧客書類には、機密情報や個人情報が含まれることがあります。画像を外部のAPIへ送信する場合、事前に入力先やデータの保存先、学習利用の有無、アクセス権限、利用範囲を確認してください。
また、不要な氏名や顔、顧客情報をマスキング(見えないように加工すること)できるかも検討が必要です。機密性が高い画像では、自社環境や閉域環境、社内承認済みのサービスを選択肢に含め、情報管理の条件を満たせるか確認しましょう。
まとめ|LLMの画像認識を導入する際は小さな検証から始めよう
- マルチモーダルLLMを使うと、画像と指示文を組み合わせて説明や質問応答、項目抽出、報告書の下書きなどをおこなえる
- 高精度な検出・計測が必要な工程では、従来の画像認識AIや人の確認との使い分けが重要になる
- 実際の画像、確認基準、期待する出力をそろえた小規模なPoCで、精度と運用条件を確かめることが重要
LLMによる画像認識は、現場画像を見て説明文や確認メモを作る作業、帳票から項目を整理する作業を支援できる可能性があります。ただし、画像の品質や指示の具体性、情報管理、人の確認工程が、最終的な業務効率を左右します。
まずは、LLMで試したい業務の画像を1種類、期待する出力を1つ決めてください。少数の実データで担当者の確認結果と比べるところから始めれば、自社で任せられる範囲と、人に残すべき判断を具体的に整理できます。


