TECHNOLOGY IT NEWS

膨大な画像データを扱うAIの処理を高速化する「領域選択エンコード技術」を開発

公開:
CodeCampが提供するDX人材育成が可能なプログラミングやITが学べる公開講座
この記事はプレスリリースです

本記事は、PR TIMESに掲載された企業・団体等のプレスリリースを原文のまま転載しています。記事内容は発表時点の情報です。

発表元
株式会社 日立製作所
配信日時
2026年8月25日 15時00分
転載日
2026年8月26日

発表内容については発表元へ、当サイト上の訂正・削除については、当サイトのお問い合わせフォームにご連絡ください。

転載
プレスリリース本文

画像内の文字を検索対象とした評価で、検索精度を維持したまま処理時間を半減

 日立は、製造・保守などのさまざまな現場で生成される膨大な画像データを、AIで扱う際の処理を高速化する「領域選択エンコード技術*1」を開発しました。画像を扱うAIモデルの基本構造 (アーキテクチャ) の一つであるVision Transformer (以下、ViT)*2は、画像データの特徴量*3を生成 (エンコード) する際に用いられており、生成した特徴量は画像分類や検索などに活用できます。しかしViTは、特徴量を生成する際に、画像全体を細かく分けた各領域に対応する膨大なトークン*4を処理するため、処理時間やGPUなどの計算資源の増大が課題でした。

 そこで日立は、画像のどの領域が精度維持に寄与するかを分析しました。その結果、対象物が写る領域に対応するトークンが精度維持に寄与していることに加え、多くの画像でAIモデルが注目する特定の位置 (固定領域) があり、それに対応するトークンが精度維持に寄与することを見いだしました。この知見に基づき、対象物が検出された領域と固定領域に対応するトークンのみを処理対象とすることで、処理量の削減に成功しました。生成した特徴量を用いる、画像内の文字を検索対象とした評価では、検索精度を維持したまま、特徴量生成に必要な平均処理時間を、従来の画像全体を処理する方式と比べて半減できることを確認しました(図1)*5。これにより、膨大な画像データを扱うAIの処理高速化に加え、GPUなどの計算資源の削減も期待できます。

 今後、日立は、お客さまとの協創を通じて実際のユースケースで価値を検証するとともに、膨大な画像や動画データの利活用を支えるAI基盤への適用を検討します。さらに、Lumada 3.0の強化を支える技術の一つとして、お客さまの業務効率化とAI向けデータインフラの高度化に貢献していきます。

図1:必要と判定した画像領域のみを処理する「領域選択エンコード技術」のイメージ
図1:必要と判定した画像領域のみを処理する「領域選択エンコード技術」のイメージ

*1 領域選択エンコード技術:画像から特徴量を生成する処理(エンコード)において、画像全体を一律に処理するのではなく、必要と判定した領域のトークンのみを処理することで、 Vision Transformer (ViT) による処理を高速化する技術。

*2 Vision Transformer (ViT):画像を細かな領域に分けて処理する、画像認識や画像検索などに用いられるAIモデルの基本構造 (アーキテクチャ)の一つ。

*3 特徴量:画像に写る物体の形や色、模様、文字などの特徴を、AIが扱いやすい数値データとして表したもの。検索、分類などの画像を扱うAIの基礎となる。Embeddingとも呼ばれる。

*4 トークン:AIが画像を処理するために、入力情報を分けた小さな単位に対応するデータ。画像においては、細かな領域ごとに分けたデータがトークンに相当する。

*5 画像に写る文字に関する検索を想定した評価条件で確認した結果。効果は、対象物の種類、画像中での写り方、使用するGPUなどの条件によって異なる。今回の評価には、Amanpreet SinghらによるTextOCRデータセット [https://textvqa.org/textocr/] (CC BY 4.0) を用いた。

背景および課題

 製造現場のカメラで撮影した製品画像から不良を見つけたり、保守現場における設備の巡回画像から異常の兆候を検知したりするなど、さまざまな分野で膨大な画像や動画データの活用が広がっています。こうした現場では、処理対象データの増加に伴い、画像認識や検索に用いるAIの処理時間が長くなり、GPUなどの計算資源も多く必要になると考えられます。その中でも、画像を扱うAIモデルの基本構造 (アーキテクチャ) の一つであるVision Transformer (ViT)は、画像データの特徴量を生成 (エンコード) する際に用いられ、生成した特徴量は画像分類や検索などに活用できます。しかし、本来は製品や設備、文字など特定の対象物に関する情報のみを処理できれば良いケースでも、画像全体を細かく分けた各領域に対応する膨大なトークンを一律に処理してしまうため、処理量が大きくなりやすいことが課題でした。このため、精度の維持に必要な情報を保ちながら、特徴量生成の処理量を抑えることが求められていました。

課題を解決するために開発した技術・ソリューションの特長

 そこで日立は、必要と判定した画像領域に対応するトークンのみをViTで処理することで、特徴量生成を高速化する「領域選択エンコード技術」を開発しました。本技術により、製品や設備、文字など特定の対象物に着目するOT分野を中心に、画像を扱うAIの処理を高速化し、GPUなどの計算資源の削減が期待できます。技術の特長は以下の通りです。

1. 必要と判定した画像領域のみを処理し、特徴量生成を高速化する技術

 本技術は、用途に応じた特定の対象物について特徴量を生成するうえで、処理が必要な画像領域を判定し、その領域のトークンのみを用いて特徴量生成 (エンコード) を行うことで、ViTで処理するデータ量を削減します。これにより、画像全体を一律に処理する場合と比べて、ViTによる特徴量生成を高速化できます。

2. AIモデルが注目する固定領域を活用した、精度維持と処理量削減を両立する技術

 AIモデルの分析により、多くの画像で特定の位置に高いAttention (注目度) が集まる固定領域があることを見いだしました。この知見に基づき、本技術では、対象物が検出された領域に加え、この固定領域に対応するトークンを処理対象として残す方式を採用しました。これにより、対象物の領域に対応するトークンのみを残した場合に生じる精度低下を抑えながら、ViTで処理するデータ量を削減できます。

確認した効果

 本技術の効果を、生成した特徴量を用いる検索タスクで評価しました。画像内の文字を検索対象とした評価では、検索精度を維持したまま、特徴量生成に必要な平均処理時間を半減できることを確認しました。これにより、膨大な画像データを扱う業務において、計算資源を抑えながらAIを活用できる可能性を示しました。

今後の展望

 今後、日立は、実際のユースケースで価値を検証するとともに、画像や動画データの利活用を支える既存のAI基盤への適用を検討していきます。これにより、膨大な画像や動画データを扱うお客さまの業務効率化を支援していきます。さらに、Lumada 3.0の強化を支える技術の一つとして、AI向けデータインフラの高度化に貢献していきます。

なお、本成果の一部はThe IEICE Transactions on Information and Systemsに掲載されました*6。

*6 論文 Accelerating Vision Transformer Models via Dynamic and Static Attention-aware Token Filtering 早期公開版 |PDF

関連情報

 日立の研究開発ウェブサイト

照会先

 株式会社日立製作所 研究開発グループ

 問い合わせフォームへ

プレスリリース転載ここまで
ブログに戻る

コメントを残す

コメントは公開前に承認される必要があることにご注意ください。

企業・法人向けのIT・プログラミング・生成AI研修を探す、比較する - IT・プログラミングを知って学べるコネクトメディア CodeCampが提供するDX人材育成が可能なプログラミングやITが学べる公開講座 - IT・プログラミングを知って学べるコネクトメディア コードキャンプが提供する無料で学べるプログラミングスクール講座 - IT・プログラミングを知って学べるコネクトメディア コードキャンプDX人材育成研修 - IT・プログラミングを知って学べるコネクトメディア 3.5日の研修で、年間1,600時間の削減効果が見込まれる。東京きらぼしフィナンシャルグループのDX人材育成事例 - IT・プログラミングを知って学べるコネクトメディア 配属3ヶ月で30%の生産性向上を実現するいよぎんコンピュータサービスの新人研修に迫る - IT・プログラミングを知って学べるコネクトメディア 金融業界の業務効率化を加速するニッセイアセットマネジメントの生成AI×GAS活用研修事例 - IT・プログラミングを知って学べるコネクトメディア 【製造業のDX人材育成事例】デジタル人材の即戦力化を実現する、日本ガイシ株式会社の異動者向オンボーディング研修 - ITやプログラミングを知って学べるコネクトメディア フューチャーアーキテクト株式会社が実現した新入社員向けIT研修プログラムでタスクフォース制度が主体的な学びと成長を生み出す - IT・プログラミングを知って学べるコネクトメディア コードキャンプDX人材育成研修 - IT・プログラミングを知って学べるコネクトメディア コードキャンプIT・プログラミング研修事例/【IT新入社員研修】オンラインとオフラインの最適バランスを実現したFutureOneの導入事例 - IT・プログラミングを知って学べるコネクトメディア コードキャンプIT・プログラミング研修事例/【新入社員研修】柔軟なハイブリッド型Java研修で実現した新卒20名の成長と成果|サークレイス株式会社 - ITやプログラミングを知って学べるコネクトメディア コードキャンプIT・プログラミング研修事例/現場により近いところにデジタルを根付かせるDX基礎講座研修|株式会社ブリヂストン - ITやプログラミングを知って学べるコネクトメディア コードキャンプIT・プログラミング研修事例/業務の効率化・DX推進に向けたIT人材育成への第一歩|株式会社カナエ - ITやプログラミングを知って学べるコネクトメディア 企業・法人向けのIT・プログラミング研修 - ITやプログラミングを知って学べるコネクトメディア

新着記事

対象者別で探す

子供(小学生・中学生・高校生)向け
プログラミング教室検索する

子供(小学生・中学生・高校生)がロボットやプログラミング言語を学ぶことができるオフラインからオンラインスクールを検索、比較することが可能です。

子供(小学生・中学生・高校生)
プログラミング教室検索する

ITやプログラムなどの
最新情報を検索する

日々、新しいITやプログラミング言語の情報が流れていきますが、特定の情報を時系列でニュースやコラムを確認することができます。

ITやプログラムなどの
最新情報を検索する