AI

スマホで動く視覚言語モデル「LFM2.5-VL-3B」が登場、日本語対応でUI認識やOCRに活用できる


アメリカに拠点を置くAI企業のLiquid AIが視覚言語モデル「LFM2.5-VL-3B」を発表しました。LFM2.5-VL-3Bはスマートフォンでも動作することが確認されている軽量VLMで、文書のOCRやUIの認識などが可能。オープンモデルとして公開されており、無償でダウンロード可能です。

LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge — Blog — Liquid AI
https://www.liquid.ai/blog/lfm2-5-vl-3b

LFM2.5-VL-3BはLFM2.5-2.6Bと同じ基盤モデルをベースに構築されたVLMです。パラメーター数は31億で、メモリ使用量は3.3GB以内に収まっています。


「LFM2.5-VL-3B(3.1B)」「LFM2-VL-3B(3.1B)」「gemma-4-E2B-it(5.1B)」「gemma-4-E4B-it(8B)」「InternVL 3.5 2B(2.4B)」「InternVL 3.5 4B(4.7B)」「Qwen3.5-2B(2.3B)」「Qwen3.5-4B(4.7B)」の推論性能や視覚認識性能を測定した結果が以下。LFM2.5-VL-3はgemma-4-E4B-itやQwen3.5-4Bといった比較的大型なモデルより高いスコアを記録しました。


LFM2.5-VL-3BはNVIDIA・AMD・Apple・Qualcommのプロセッサーをサポートしており、ノートPCやスマートフォンで実行することもできます。以下の図は「AMD Ryzen AI Max+ 395を搭載したPC」「Apple M5 Maxを搭載したMac」「QualcommのSoCを搭載したGalaxy S26 Ultra」で各種モデルに画像とテキストを入力した際の「最初のトークンを出力するまでの遅延(ミリ秒)」「デコード速度(tok/s)」「使用メモリ(MB)」を示しています。LFM2.5-VL-3BはGalaxy S26 Ultraで毎秒20トークンのデコードが可能です。


NVIDIAのH100で各種モデルに画像やテキストを入力した際の最初のトークン出力までの時間を比較したグラフが以下。LFM2.5-VL-3Bは「256×256ピクセル・5フレームの動画」を入力するタスクでも34ミリ秒という短い遅延で処理可能です。


対応言語は英語・アラビア語・中国語・フランス語・ドイツ語・イタリア語・日本語・韓国語・ポルトガル語・スペイン語・ベトナム語・タイ語・インドネシア語・ヒンディー語・ロシア語・ポーランド語です。以下の動画ではLFM2.5-VL-3Bで文書のOCRを行う様子を確認できます。

LFM2.5-VL-3B: Document OCR and Layout Understanding in WebGPU - YouTube


PCやスマートフォンの画面UIを正確に認識することもできます。

LFM2.5-VL-3B: Screen and UI Understanding in WebGPU - YouTube


LFM2.5-VL-3Bは以下のリンク先で公開されています。すでに「llama.cpp」「MLX」「vLLM」「SGLang」「ONNX」での動作に対応しており、オンデバイス処理から大規模なサービス展開までサポート可能です。

LiquidAI/LFM2.5-VL-3B · Hugging Face
https://huggingface.co/LiquidAI/LFM2.5-VL-3B

また、ドキュメントは以下のリンク先で確認できます。

LFM2.5-VL-3B - Liquid Docs
https://docs.liquid.ai/lfm/models/lfm25-vl-3b

・関連記事
スマホで動作するエージェント対応小型AIモデル「LFM2.5-2.6B」が登場、ローカル環境でAIエージェントを実行可能 - GIGAZINE

スマホでも動作する日本語対応小型AIモデル「LFM2.5-8B-A1B」が登場 - GIGAZINE

iPhoneで動作しBonsai 27Bと同等性能で13倍高速なAI「Maple-Preview」が登場、ローカルAIがまた1歩前進 - GIGAZINE

iPhoneでローカル実行可能な270億パラメータのAIモデル「Bonsai 27B」が登場、Qwen3.6-27Bをメモリ使用量3.9GBまで小型化してスマホ単体で実用的な速度で動作 - GIGAZINE

iPhoneでローカル動作する画像生成AI「Bonsai Image 4B」が登場したので使ってみた、FLUX.2 Klein 4Bを1bit版に魔改造してメモリ使用量を8.3分の1に削減 - GIGAZINE

in AI, Posted by log1o_hf

You can read the machine translated English article A smartphone-compatible visual language ….