·科技·
N3

スマホで動く視覚言語モデル「LFM2.5-VL-3B」が登場 日本語のOCRやUI認識に対応

能在智慧型手機上運行的視覺語言模型「LFM2.5-VL-3B」登場 支援日文OCR與UI辨識

#AI#スマートフォン#視覚言語モデル
0:00 / 0:00

スマートフォン画像がぞう文字もじたり画面がめんボタンデザイン理解りかいたりできるあたらしいAIモデル登場とうじょうしました。アメリカAI企業きぎょう「Liquid AI発表はっぴょうした「LFM2.5-VL-3B」スマートフォンノートパソコンなど身近みじかデバイス直接ちょくせつうごかすことできる軽量けいりょう視覚言語しかくげんごモデル(VLM)ですこのモデルオープンソース無料むりょう公開こうかいおりだれダウンロード使つかことできます。

V1たりV2たりできる= 能夠進行如V1與V2等動作Vることができる= 能夠做……

「LFM2.5-VL-3B」写真しゃしん書類しょるい文字もじさがOCR機能きのうアプリ画面がめん構成こうせい見分みわけるUI認識にんしき能力のうりょくいます。データサイズやく31おくパラメーター動作どうさ必要ひつようメモリ3.3GB以下いかおさられいます。テストよりサイズおおきいほかAIモデルよりたか性能せいのう記録きろくしました。さらにスマートフォン(Galaxy S26 Ultra)1びょうあたり20トークンはや文章ぶんしょう作成さくせいできるなど素早すばや応答おうとう可能かのうです

Nに抑えられる= 被控制在……以下

これまで大型おおがたクラウドサーバーしか処理しょりできなかっ高度こうどAI機能きのう手元てもとスマートフォンパソコン安全あんぜんかつ素早すばやうごかせる期待きたいいます。NVIDIAAMD、Apple、Qualcommなど多様たようチップ搭載とうさいした機器きき利用りようできるため今後こんごさまざまアプリ活用かつようひろがりそうです

〜でしかVない= 只能在……進行Vそう= 看起來會…… / 前景似乎會……

學習筆記

文法整理

句型意思
V1たりV2たりできる能夠進行如V1與V2等動作
Vることができる能夠做……
Nに抑えられる被控制在……以下
〜でしかVない只能在……進行
Vそう看起來會…… / 前景似乎會……

詞彙整理

單字讀音等級意思
登場とうじょうN3登場 / 推出
発表はっぴょうN3發表 / 公布
身近みじかN3切身 / 身邊的
直接ちょくせつN3直接
公開こうかいN3公開 / 開放
書類しょるいN3文件 / 書類
記録きろくN3記錄 / 創下
高度こうどN3高度的 / 高階的
活用かつようN3活用 / 應用
素早いすばやいN2飛快的 / 迅速的

延伸學習

  • 視覺語言模型(VLM)可讀取圖片中的文字,並辨識應用程式畫面的版面與按鈕等元素。
  • LFM2.5-VL-3B 約有 31 億個參數,所需記憶體不超過 3.3GB,且在 Galaxy S26 Ultra 上每秒可生成 20 個 Token。

練習

測試你剛學到的內容。

  1. このモデルはオープンソースとして無料で されており、だれでもダウンロードして使うことができます。

  2. 記事によると、「LFM2.5-VL-3B」の特徴として正しいものはどれですか。

  3. 「Vることができる」の文法的な意味として正しいものはどれですか。

Source: Gigazine