文章定位:深度技術整理|影片來源:Bilibili:英伟达开源了定位万物的AI模型

影片介紹的模型是 LocateAnything-3B。它不是只回答「圖中有甚麼」的視覺問答模型,而是能把自然語言描述對應到圖片中的實際位置,輸出 bounding box 或 point。你可以要求它找人、車、按鈕、文字、文件區塊,甚至用「戴紅帽、站在右邊的人」這類描述定位。

不過,「3B 參數干出 32B 戰鬥力」及「筆記本也能跑」都需要拆開理解:前者不是說 3B 在所有任務都等同 32B,後者也不代表任何普通筆電都能流暢執行官方 BF16 版本。

一、LocateAnything 是甚麼?

LocateAnything 是 NVIDIA Eagle VLM 家族的視覺語言模型,定位為快速、高品質的 visual grounding 模型。Visual grounding 的重點是同時理解文字和空間位置,將描述對應回圖像中的目標。

  • 開放詞彙物件偵測,不限於固定類別清單。
  • Referring expression grounding,按自然語言描述找目標。
  • 密集場景、多物件偵測。
  • GUI 元素 grounding,找按鈕、輸入框等介面元件。
  • 文件版面、OCR 文字及表格區塊定位。
  • Point-based localization,以及機械人、駕駛、工業檢查等空間理解。

二、它如何把一句話變成框?

模型由 Qwen2.5-3B-Instruct 語言模型、MoonViT-SO-400M 視覺編碼器及多模態 MLP projector 組成。圖片先轉成視覺特徵,文字提示由語言模型理解,最後輸出語義標籤與結構化座標 token。

輸出不是直接回傳一個 JSON 框,而是由特殊 token 表示座標,再由後處理還原成 [x1, y1, x2, y2] 或點座標。這讓語言描述和空間位置可以放在同一個視覺語言生成流程內。

三、Parallel Box Decoding 是關鍵

一般自回歸模型會逐個 token 生成標籤及座標,目標一多,延遲便會累積。LocateAnything 的核心創新是 Parallel Box Decoding(PBD):把完整框座標組成固定結構的 block,使用平行多 token 預測,減少逐 token 解碼成本。

官方模型卡稱,PBD 在維持幾何一致性的同時,最高可帶來約 2.5 倍 throughput 提升。模型提供三種模式:

  • Fast:主要使用平行預測,速度較快。
  • Slow:純自回歸生成,通常較慢。
  • Hybrid:預設模式,先平行解碼,格式不規則或空間歧義時回退自回歸。

因此小模型的效率不只來自參數少,也來自針對 grounding 任務設計輸出格式和解碼路徑。

四、3B 為何可能有很強表現?

模型能力不能只看參數量。官方資料指出,訓練資料涵蓋約 1,200 萬張圖片、超過 1.38 億條 queries 及約 7.85 億個 bounding boxes,資料域包括自然圖像、機械人、駕駛、GUI、文件與 OCR。

專門化訓練令 3B 模型在「按照文字找出圖像位置」這類任務上,可能比更大的通用模型更有效率。但這不代表它在長文本推理、寫程式、複雜知識問答或所有視覺任務都能擊敗 32B。

比較時應確認:比較的是 grounding 還是一般 VQA?是否使用相同圖片與提示?比較準確率、速度、記憶體還是總成本?大模型是否採用相同的解碼策略?較嚴謹的結論是:LocateAnything-3B 在視覺定位這個專門任務上,透過資料及解碼設計取得高效率和競爭力。

五、到底能不能在筆電跑?

官方原始整合方式是 Transformers、BF16 推理,優先支援 NVIDIA Ampere、Lovelace、Hopper 和 Blackwell GPU,測試硬件包括 A100、H100 及 RTX 4090 類別。不能由「3B」三個字推論任何筆電都能即時運行。

開源社群已提供不同本地路線:

  • GGUF/locate-anything.cpp:基於 ggml 的 C++ port,可用 CPU 或 GPU backend,推理時不需 Python。
  • Q8_0 GGUF:社群資料列出約 6.3 GB,測試中定位框與 f32 版本一致。
  • Q6_K、Q5_K、Q4_K:檔案更小,但可能出現小幅座標漂移。
  • MLX:可探索 Apple Silicon 本地運行。
  • ONNX WebGPU INT4:有社群轉換版本,但不是 NVIDIA 官方支援。

較準確的解讀是:有足夠 RAM/VRAM 的較新 NVIDIA 筆電、Apple Silicon 機器,或採量化 CPU port 的筆電,有機會本地執行;速度、圖片解析度、並發量和首次載入時間會有很大差異。沒有獨立 GPU 的普通筆電即使能跑量化版本,也不一定有即時體驗。

六、本地部署路線

官方 Transformers

適合研究官方模型、修改 Python pipeline 或做學術實驗。需要 Linux、相容 NVIDIA GPU、CUDA/PyTorch/Transformers 及足夠顯存。官方模型卡目前未列出 TensorRT、TensorRT-LLM 或 Triton 正式支援。

GGUF + locate-anything.cpp

適合個人電腦用 CLI、CPU 或較輕量的 C++ runtime:

TEXT
locate-anything-cli detect --model models/locate-anything-q8_0.gguf --input street.jpg --prompt "Locate all the instances that matches the following description: person</c>car." --annotated out.png

Docker Web UI

社群 Web UI 可上傳圖片、輸入 prompt、查看框選結果及切換 fast/hybrid/slow 模式,但通常仍需要 Linux/WSL2、Docker、NVIDIA Container Toolkit 及支援 BF16 的 GPU。

七、適合的用途

  • 用自然語言輔助圖片標註及建立 detection dataset。
  • 將「找提交按鈕」等命令轉成 GUI 座標。
  • 定位文件標題、表格、欄位和 OCR 文字。
  • 以描述搜尋長尾物件,不限固定類別。
  • 支援機械人、工業檢查和視覺自動化流程。

八、限制與授權

  • 定位準確不等於理解物件身份、意圖或安全狀態,高風險用途必須人工複核。
  • 遮擋、極小物件、低清圖片、非英文 prompt 及陌生領域可能降低穩定性。
  • 監控畫面和文件可能含個人資料,部署前要處理權限、保存和私隱。
  • 官方模型授權是 NVIDIA License,模型卡明確限制為學術及非牟利研究,商業使用不被允許,NVIDIA 及其關聯公司除外。
  • 第三方 GGUF、Web UI 或 C++ port 的程式碼授權,與 NVIDIA 模型權重授權不同;使用 port 不會自動取得模型商業權利。

九、結論

LocateAnything-3B 的真正價值不是單純「參數少」,而是把視覺語言模型的輸出由聊天文字推進到可操作座標。PBD 提高多框解碼效率,開放詞彙設計則適合 GUI agent、資料標註、文件理解及視覺自動化。

個人電腦使用者可先用 GGUF port 做單圖測試,量度速度、記憶體和框的位置,再決定是否配置 NVIDIA GPU。商業產品則要先處理授權;模型能公開下載,不代表可以商用。

來源與核實

查閱日期:2026-08-06