GPT
L

LFM2-VL-1.6B

קוד פתוח

LiquidAIother2025-08-12

  • transformers
  • safetensors
  • lfm2_vl
  • image-text-to-text
  • liquid

מודל ראייה ושפה קומפקטי שתוכנן לרוץ מהר על חומרת קצה. אם אתם צריכים הבנת תמונה טובה בלי להחזיק שרת כבד, הוא נותן פתרון יעיל במיוחד.

  • 1.6Bפרמטרים
  • 128,000טוקנים בהקשר
  • 3.0 GBמשקל הקבצים
  • 33,781הורדות בחודש

מה זה

המודל משלב שכבות קונבולוציה ותשומת לב כדי להגיע למהירות היסק כפולה על מעבדים גרפיים ביחס למודלי ראייה מקבילים. הוא מחבר מודל שפה של 1.2 מיליארד פרמטרים עם מקודד תמונה SigLIP2 בגודל 400 מיליון פרמטרים. התוצאה היא מערכת קלה שמיועדת בעיקר למכשירי קצה ולזרימות עבודה של סוכנים אוטומטיים.

הייחוד הטכני כאן הוא טיפול בתמונות ברזולוציה מקורית עד 512 על 512, וחלוקה של תמונות גדולות יותר למקטעים בלי לעוות את יחס הגובה והרוחב. במבחני ביצועים הוא עוקף מודלים כמו InternVL3-2B במעקב אחרי הוראות מורכבות עם ציון של 46.35 ב־MM-IFEval, אבל מפגר מאחוריו במשימות OCR עם 729 נקודות לעומת 831, וגם במבחני ידע כללי מולטימודלי כמו MMMU.

מתאים ל

  • סוכן חזותי למכשירי קצה

    הוא רץ מהר בזיכרון נמוך ומאפשר זיהוי מצבים ותגובה לפקודות מקומיות בזמן אמת.

  • מיון וסינון תמונות מהיר

    התאמת מספר הטוקנים לפי גודל התמונה חוסכת זמן עיבוד יקר במאגרים גדולים.

  • תיאור תמונות באנגלית

    הוא מצטיין במעקב אחר הנחיות טקסטואליות ובשילוב נתונים מתמונות ברזולוציה גמישה.

איפה זה נופל

הכרטיס מגדיר תמיכה בשפה האנגלית בלבד, כך שבלי אימון נוסף אין מה לבנות עליו לעברית. היוצרים מדגישים במפורש שהוא לא נועד להחלטות קריטיות מבחינת בטיחות, ושהוא קטן מכדי לשמש כמודל רב תכליתי מושלם בלי שתבצעו לו כוונון עדין למשימה ספציפית. בנוסף, ביצועי פענוח הטקסט מתוך תמונה חלשים משמעותית ביחס למתחרים באותה קטגוריה.

אותה משפחה

LFM2-VL יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו לקריאת קבלות או מסמכים בעברית?

לא מומלץ. הוא אומן רשמית רק באנגלית, ומבחני ה־OCR שלו חלשים אפילו ביחס למודלים קטנים אחרים. למסמכים סרוקים עדיף מודל ייעודי לטקסט.

כמה משאבי חומרה צריך כדי לכוונן אותו על דאטה שלי?

היוצרים מספקים מחברת מוכנה לביצוע LoRA עם ספריית TRL. מאחר שמדובר במודל של 1.6 מיליארד פרמטרים בלבד, אפשר לאמן אותו על כרטיס מסך בודד ברמת צרכן בלי להיכנס להוצאות ענן כבדות.

איך מריצים

המשקל הכולל של הקבצים עומד על 3 גיגה בייט בפורמט bfloat16, כך שאפשר להריץ אותו בקלות על כרטיס מסך בסיסי עם 6 עד 8 גיגה זיכרון, או על מחשב נייד מודרני באמצעות ספריית transformers מגרסה 4.57 ומעלה. מי שצריכים חיסכון קיצוני עוד יותר במשאבים יכולים לבחור באח הקטן שלו, שמגיע עם 450 מיליון פרמטרים בלבד.

אין סיבה לשלם על API חיצוני למשימות פשוטות כשהמשקל כל כך נמוך וההרצה מקומית ומהירה. שווה לפנות למודלים ענקיים דרך ממשק חיצוני רק אם אתם צריכים קריאת מסמכים צפופים בעברית או ניתוח לוגי רב שלבי שהגודל הזה פשוט לא מסוגל לספק.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="LiquidAI/LFM2-VL-1.6B")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון ייעודי בשם LFM Open License v1.0 ולא תחת רישיון קוד פתוח סטנדרטי כמו אפאצ'י או MIT. מפתח שרוצה להטמיע אותו במוצר מסחרי חייב לקרוא היטב את תנאי הרישיון המקוריים של החברה כדי לוודא שאין שם מגבלות הפצה או דרישות מסחריות מיוחדות.

הרישיון המלא בעמוד המודל ↗