Liquid AI LFM2.5-VL-3B: wizja i język na urządzeniach brzegowych
Liquid AI wydała model LFM2.5-VL-3B z 3,1 miliardami parametrów do pracy na smartfonach i laptopach.
Model LFM2.5-VL-3B wydany przez Liquid AI 12 sierpnia 2026 roku to model widzenia i języka zaprojektowany do działania bezpośrednio na urządzeniach użytkowników, a nie w chmurze.
Specyfikacja i architektura modelu
Model łączy kodery widzenia SigLIP2 400M NaFlex od Google z pre-trenowanym modelem tekstu LFM2.5-2.6B. Został wytrenowany na około 34 bilionach tokenów, przy czym ilość danych obrazowych czterokrotnie przewyższa poprzednią wersję. Słownictwo rozszerzone do 128 tysięcy tokenów wspiera skrypty niezachodnie, co ułatwia pracę z tekstami w arabskim, chińskim, japońskim i hinduskim.
Proces szkolenia obejmował nadzorowane dokształcanie, destylację wiedzy z większego modelu nauczyciela oraz wielonagrodowe uczenie wzmacniające. Długość kontekstu wynosi 32 768 tokenów, co pozwala na przetwarzanie dłuższych sekwencji tekstu.
Jak model radzi sobie w benchmarkach?
Wyniki testów pokazują znaczący postęp w czterech kluczowych obszarach. W zrozumieniu ekranu — zdolności do interpretacji interfejsów użytkownika — model osiąga średnio 80,7 punktu na testach ScreenSpot-v2, podczas gdy poprzednia wersja uzyskała wynik jednoliczbowy. To pozycjonuje go przed modelem Gemma-4-E4B (50,9 punktu), choć za InternVL 3.5 4B (84,2 punktu).
W ugruntowaniu obiektów — zwracaniu prostokątów ograniczających dla rzeczy opisanych słowami — precyzja RefCOCO wzrosła z 57,1 do 87,9 punktu, czyli wzrost o ponad 30 punktów. Liquid AI przypisuje tę poprawę skalowanym syntetycznym danym treningowym.
Wywoływanie funkcji to nowa możliwość w rodzinie modeli wizji firmy. Na benchmarku ToolSandbox wynik ponad się podwoił, z 26,4 do 59,5 punktu, stawiając model 3,1B na równi z Gemma-4-E2B i przed Qwen3.5-2B.
Wieloobrazowa inferencja — zdolność do przetwarzania wielu obrazów w jednym zapytaniu — również znacznie się poprawiła. Na teście BLINK wzrost z 50,2 do 61,5 punktu, a na MuirBench z 34,9 do 58,3 punktu.
| Obszar zdolności | Poprzednia wersja | LFM2.5-VL-3B | Wzrost |
|---|---|---|---|
| Zrozumienie ekranu (ScreenSpot-v2) | Jednocyfrowy | 80,7 | Znaczący |
| Ugruntowanie obiektów (RefCOCO) | 57,1 | 87,9 | +30,8 pkt |
| Wywoływanie funkcji (ToolSandbox) | 26,4 | 59,5 | +33,1 pkt |
| Wieloobrazowa inferencja BLINK | 50,2 | 61,5 | +11,3 pkt |
| Wieloobrazowa inferencja MuirBench | 34,9 | 58,3 | +23,4 pkt |
Na całym zbiorze 28 benchmarków wizji model uzyskuje średni wynik 69,4 punktu, co stanowi wzrost o 12 punktów w stosunku do poprzednika (57,2 punktu). Wynik plasuje go w granicach 0,7 punktu od większego modelu Qwen3.5-4B o 4,7 miliardach parametrów.
Szybkość działania na różnych urządzeniach
Model został zaprojektowany jako system nieinferencyjny — odpowiada bezpośrednio bez generowania pośrednich łańcuchów myśli. To podejście optymalizuje opóźnienie, czyniąc go przydatnym do zadań wymagających szybkiej odpowiedzi.
Na procesorze Apple M5 Max model osiąga szybkość dekodowania 228 tokenów na sekundę przy zużyciu około 3 gigabajtów pamięci. Na procesorze AMD Ryzen AI Max+ 395 wynik wynosi 116 tokenów na sekundę. Na smartfonie Galaxy S26 Ultra — 20 tokenów na sekundę.
Na karcie graficznej NVIDIA H100 czas do pierwszego tokenu wynosi około 34 milisekund dla pięcioklatkowego klipu wideo. Przepływ wyjściowy przy wysokiej współbieżności osiąga około 11 tysięcy tokenów na sekundę, co Liquid AI szacuje na prawie miliard tokenów wyjściowych dziennie na jednej karcie.
Do czego model jest przeznaczony?
Producent wyraźnie wskazuje przypadki użycia: detekcja obiektów w czasie rzeczywistym dla aplikacji samochodowych, wsadowe rozpoznawanie znaków w skanowanych dokumentach, tłumaczenie tekstu z menu i znaków drogowych bezpośrednio na urządzeniu użytkownika. Wszystkie to zadania jednoobrotu, niskoopóźnieniowe.
Model nie jest zalecany do długich zadań inferencji, takich jak projektowanie stron internetowych czy odpowiadanie na zaawansowane pytania techniczne. Producent oznacza format anotacji OCR jako eksperymentalny, ostrzegając, że może być zawodny.
Dostępność i integracja
Wagi modelu są dostępne do pobrania z platformy Hugging Face na licencji open-weight. Kwantyzowane wersje dostępne w formatach GGUF, ONNX i MLX wspierają popularne frameworki: llama.cpp, MLX, vLLM, SGLang oraz ONNX Runtime od dnia wydania.
Demo WebGPU pozwala uruchomić model całkowicie w przeglądarce internetowej. Dokumentacja zawiera notesy do fine-tuningu, umożliwiające dostosowanie modelu do konkretnych zadań ugruntowania, OCR lub wywoływania funkcji.
Co to oznacza dla praktyki
Wydanie LFM2.5-VL-3B sygnalizuje przesunięcie w kierunku modeli wizji zdolnych do pracy na urządzeniach brzegowych bez połączenia sieciowego. Dla programistów oznacza to możliwość budowania aplikacji, które przetwarzają obrazy lokalnie, chroniąc prywatność użytkownika i zmniejszając opóźnienia. Dla firm zajmujących się mobilnością, logistyką czy handlem — potencjał do wdrażania systemów wizyjnych na istniejącym sprzęcie bez inwestycji w infrastrukturę serwerową.
Benchmarki raportowane przez dostawcę nie mają jeszcze niezależnych potwierdzań, co jest normalnym stanem w dniu wydania. Rzeczywiste wyniki mogą się różnić w zależności od konfiguracji i sposobu testowania, dlatego warto śledzić niezależne oceny w kolejnych tygodniach.
Model uzupełnia rodzinę LFM2.5, którą Liquid AI rozbudowywała przez drugą połowę 2026 roku — wcześniej wydając model tekstu LFM2.5-2.6B oraz warianty dla długiego kontekstu. LFM2.5-VL-3B stanowi flagowy wariant wizji, poprzedzony mniejszymi wersjami o 1,6 miliardach i 450 milionach parametrów.
Na podstawie: Unite.AI. Tekst opracowany redakcyjnie.