文章定位:深度技術整理|影片來源:Bilibili:英伟达开源了定位万物的AI模型
影片介紹的模型是 LocateAnything-3B。它不是只回答「圖中有甚麼」的視覺問答模型,而是能把自然語言描述對應到圖片中的實際位置,輸出 bounding box 或 point。你可以要求它找人、車、按鈕、文字、文件區塊,甚至用「戴紅帽、站在右邊的人」這類描述定位。
不過,「3B 參數干出 32B 戰鬥力」及「筆記本也能跑」都需要拆開理解:前者不是說 3B 在所有任務都等同 32B,後者也不代表任何普通筆電都能流暢執行官方 BF16 版本。
一、LocateAnything 是甚麼?
LocateAnything 是 NVIDIA Eagle VLM 家族的視覺語言模型,定位為快速、高品質的 visual grounding 模型。Visual grounding 的重點是同時理解文字和空間位置,將描述對應回圖像中的目標。
- 開放詞彙物件偵測,不限於固定類別清單。
- Referring expression grounding,按自然語言描述找目標。
- 密集場景、多物件偵測。
- GUI 元素 grounding,找按鈕、輸入框等介面元件。
- 文件版面、OCR 文字及表格區塊定位。
- Point-based localization,以及機械人、駕駛、工業檢查等空間理解。
二、它如何把一句話變成框?
模型由 Qwen2.5-3B-Instruct 語言模型、MoonViT-SO-400M 視覺編碼器及多模態 MLP projector 組成。圖片先轉成視覺特徵,文字提示由語言模型理解,最後輸出語義標籤與結構化座標 token。
輸出不是直接回傳一個 JSON 框,而是由特殊 token 表示座標,再由後處理還原成 [x1, y1, x2, y2] 或點座標。這讓語言描述和空間位置可以放在同一個視覺語言生成流程內。
三、Parallel Box Decoding 是關鍵
一般自回歸模型會逐個 token 生成標籤及座標,目標一多,延遲便會累積。LocateAnything 的核心創新是 Parallel Box Decoding(PBD):把完整框座標組成固定結構的 block,使用平行多 token 預測,減少逐 token 解碼成本。
官方模型卡稱,PBD 在維持幾何一致性的同時,最高可帶來約 2.5 倍 throughput 提升。模型提供三種模式:
- Fast:主要使用平行預測,速度較快。
- Slow:純自回歸生成,通常較慢。
- Hybrid:預設模式,先平行解碼,格式不規則或空間歧義時回退自回歸。
因此小模型的效率不只來自參數少,也來自針對 grounding 任務設計輸出格式和解碼路徑。
四、3B 為何可能有很強表現?
模型能力不能只看參數量。官方資料指出,訓練資料涵蓋約 1,200 萬張圖片、超過 1.38 億條 queries 及約 7.85 億個 bounding boxes,資料域包括自然圖像、機械人、駕駛、GUI、文件與 OCR。
專門化訓練令 3B 模型在「按照文字找出圖像位置」這類任務上,可能比更大的通用模型更有效率。但這不代表它在長文本推理、寫程式、複雜知識問答或所有視覺任務都能擊敗 32B。
比較時應確認:比較的是 grounding 還是一般 VQA?是否使用相同圖片與提示?比較準確率、速度、記憶體還是總成本?大模型是否採用相同的解碼策略?較嚴謹的結論是:LocateAnything-3B 在視覺定位這個專門任務上,透過資料及解碼設計取得高效率和競爭力。
五、到底能不能在筆電跑?
官方原始整合方式是 Transformers、BF16 推理,優先支援 NVIDIA Ampere、Lovelace、Hopper 和 Blackwell GPU,測試硬件包括 A100、H100 及 RTX 4090 類別。不能由「3B」三個字推論任何筆電都能即時運行。
開源社群已提供不同本地路線:
- GGUF/locate-anything.cpp:基於 ggml 的 C++ port,可用 CPU 或 GPU backend,推理時不需 Python。
- Q8_0 GGUF:社群資料列出約 6.3 GB,測試中定位框與 f32 版本一致。
- Q6_K、Q5_K、Q4_K:檔案更小,但可能出現小幅座標漂移。
- MLX:可探索 Apple Silicon 本地運行。
- ONNX WebGPU INT4:有社群轉換版本,但不是 NVIDIA 官方支援。
較準確的解讀是:有足夠 RAM/VRAM 的較新 NVIDIA 筆電、Apple Silicon 機器,或採量化 CPU port 的筆電,有機會本地執行;速度、圖片解析度、並發量和首次載入時間會有很大差異。沒有獨立 GPU 的普通筆電即使能跑量化版本,也不一定有即時體驗。
六、本地部署路線
官方 Transformers
適合研究官方模型、修改 Python pipeline 或做學術實驗。需要 Linux、相容 NVIDIA GPU、CUDA/PyTorch/Transformers 及足夠顯存。官方模型卡目前未列出 TensorRT、TensorRT-LLM 或 Triton 正式支援。
GGUF + locate-anything.cpp
適合個人電腦用 CLI、CPU 或較輕量的 C++ runtime:
locate-anything-cli detect --model models/locate-anything-q8_0.gguf --input street.jpg --prompt "Locate all the instances that matches the following description: person</c>car." --annotated out.pngDocker Web UI
社群 Web UI 可上傳圖片、輸入 prompt、查看框選結果及切換 fast/hybrid/slow 模式,但通常仍需要 Linux/WSL2、Docker、NVIDIA Container Toolkit 及支援 BF16 的 GPU。
七、適合的用途
- 用自然語言輔助圖片標註及建立 detection dataset。
- 將「找提交按鈕」等命令轉成 GUI 座標。
- 定位文件標題、表格、欄位和 OCR 文字。
- 以描述搜尋長尾物件,不限固定類別。
- 支援機械人、工業檢查和視覺自動化流程。
八、限制與授權
- 定位準確不等於理解物件身份、意圖或安全狀態,高風險用途必須人工複核。
- 遮擋、極小物件、低清圖片、非英文 prompt 及陌生領域可能降低穩定性。
- 監控畫面和文件可能含個人資料,部署前要處理權限、保存和私隱。
- 官方模型授權是 NVIDIA License,模型卡明確限制為學術及非牟利研究,商業使用不被允許,NVIDIA 及其關聯公司除外。
- 第三方 GGUF、Web UI 或 C++ port 的程式碼授權,與 NVIDIA 模型權重授權不同;使用 port 不會自動取得模型商業權利。
九、結論
LocateAnything-3B 的真正價值不是單純「參數少」,而是把視覺語言模型的輸出由聊天文字推進到可操作座標。PBD 提高多框解碼效率,開放詞彙設計則適合 GUI agent、資料標註、文件理解及視覺自動化。
個人電腦使用者可先用 GGUF port 做單圖測試,量度速度、記憶體和框的位置,再決定是否配置 NVIDIA GPU。商業產品則要先處理授權;模型能公開下載,不代表可以商用。
來源與核實
- Bilibili 影片:英伟达开源了定位万物的AI模型
- NVIDIA LocateAnything-3B 模型卡
- NVIDIA Eagle/Embodied GitHub
- NVIDIA Research:LocateAnything
- locate-anything.cpp
- locate-anything Docker Web UI
- LocateAnything 技術報告
查閱日期:2026-08-06
留言
暫時未有公開留言。
登入後可以留言。