GPT
L

LFM2.5-VL-3B

קוד פתוח

LiquidAIother2026-08-11

  • transformers
  • safetensors
  • lfm2_vl
  • image-text-to-text
  • liquid

מודל ראייה ושפה קומפקטי של 3.1 מיליארד פרמטרים שרץ ישירות על המכשיר. הוא מתאים למי שצריך תיוג מסכים, זיהוי אובייקטים או OCR מהיר בלי לשלוח מידע לענן.

  • 3.1Bפרמטרים
  • 32,768טוקנים בהקשר
  • 5.8 GBמשקל הקבצים
  • 27,894הורדות בחודש

מה זה

המודל משלב מודל שפה של 2.6 מיליארד פרמטרים עם רכיב עיבוד תמונה SigLIP2 NaFlex בגודל 400 מיליון פרמטרים. תמונות גדולות מחולקות למקטעים של 512 על 512 פיקסלים, לצד תמונה מוקטנת של כל המסמך. הוא תומך בהפעלת פונקציות בקוד פייתון ובפענוח מבנה עמודים, כולל סימון קואורדינטות של תיבות סביב טקסטים, תמונות ומשוואות במבנה מוגדר.

בבנצ'מרקים המפרסמים מציגים קפיצה ביחס לגרסה הקודמת. במבחן ScreenSpot-v2 להבנת ממשקים ומסכים הוא מקבל 80.7 לעומת מתחרים כמו Qwen3.5-4B שמגיע ל־78.5. ב־RefCOCO למציאת אובייקטים לפי תיאור הוא הגיע ל־87.9 לעומת 57.1 בגרסה הקודמת. עם זאת, בבחינת יכולות חשיבה כמו MMMU Pro הוא השיג 30.5 בלבד, ציון נמוך משמעותית ממודלים כמו Qwen3.5-4B שמגיע ל־60.9, מה שמעיד על הבנה ישירה ולא על יכולת לפתור בעיות מורכבות.

מתאים ל

  • חילוץ נתונים מטפסים

    מייצר קואורדינטות וטקסט לפי אזורים מוגדרים במסמך, כולל טבלאות ומשוואות.

  • זיהוי אלמנטים במסכים

    מגיע לתוצאה של 80.7 ב־ScreenSpot-v2, מה שמתאים לאוטומציה של ממשקי משתמש.

  • עיבוד תמונה מקומי במכשיר

    תופס פחות מ־3.3 גיגהבייט זיכרון ורץ ב־20 טוקנים לשנייה על מעבדי מובייל.

איפה זה נופל

היוצרים מגדירים מפורשות שהמודל לא מתאים למשימות עתירות חשיבה או לניתוח שרטוטים טכניים מורכבים. מבנה הפלט לזיהוי מסמכים מוגדר עדיין כניסיוני, לא תמיד אמין ועלול להשתנות. בנוסף, רשימת השפות הנתמכת לא כוללת עברית, כך שלא כדאי לבנות עליו לפענוח מסמכים או תפריטים מקומיים.

אותה משפחה

LFM2.5-VL יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לפענוח טקסט ומסמכים בעברית?

החומר הרשמי מפרט רשימת שפות שכוללת אנגלית, ערבית, סינית, צרפתית, גרמנית, רוסית ועוד, אך עברית אינה מופיעה בה. לא מומלץ להשתמש בו לקריאת מסמכים בעברית ללא אימון נוסף.

באיזה פורמט כדאי להריץ אותו על מחשב נייד?

עבור מחשבי מק כדאי לקחת את גרסת ה־MLX שמפיקה מהירויות גבוהות במיוחד על חומרת אפל. למחשבי פיסי ולינוקס עדיף לפנות לקובצי ה־GGUF דרך llama.cpp כדי להוריד את צריכת הזיכרון אל מתחת ל־3.3 גיגהבייט.

איך מריצים

המשקלים המקוריים שוקלים 5.8 גיגהבייט ודורשים תמיכה בספריית transformers מגרסה 5 ומעלה, ביחד עם ספריות torch ו־torchvision. המודל זמין גם בגרסאות מכווצות ל־GGUF עבור llama.cpp, ב־ONNX להרצה בדפדפן ובמובייל, וב־MLX לעבודה מואצת על מעבדי אפל. בגרסאות המכווצות הוא תופס פחות מ־3.3 גיגהבייט זיכרון עבודה, ומפיק 228 טוקנים לשנייה על מעבד M5 Max ו־20 טוקנים לשנייה על מכשיר Galaxy S26 Ultra.

בשרתים, vLLM ו־SGLang מאפשרים להריץ אותו בקצב גבוה מאוד שמגיע עד 11,000 טוקנים לשנייה על כרטיס H100 יחיד. אם אתם צריכים זמני תגובה מיידיים במכשיר הקצה של המשתמש, שווה להריץ את גרסת ה־ONNX או GGUF מקומית. אם אתם מעבדים מסמכים סבוכים בתדירות נמוכה ואין לכם מגבלת פרטיות, מודלים גדולים יותר דרך API יעשו עבודה אמינה בהרבה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="LiquidAI/LFM2.5-VL-3B")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ולא תחת רישיון קוד פתוח סטנדרטי כמו אפאצ'י או MIT. המשמעות היא שחובה לבדוק את תנאי השימוש הספציפיים באתר החברה לפני שמשלבים אותו במוצר מסחרי, ולא להניח שהפצה חופשית מותרת.

הרישיון המלא בעמוד המודל ↗