GPT
L

LFM2.5-VL-1.6B-Extract

קוד פתוח

LiquidAIother2026-05-26

  • transformers
  • safetensors
  • lfm2_vl
  • image-text-to-text
  • liquid

מודל ראייה קטן שמחלץ נתונים מתמונה ישירות לתוך מבנה JSON מוגדר מראש. הוא נבנה כדי לבצע משימה אחת מוגדרת בלי לבזבז משאבים על שיחה חופשית.

  • 1.6Bפרמטרים
  • 128,000טוקנים בהקשר
  • 3.1 GBמשקל הקבצים
  • 1,938הורדות בחודש

מה זה

במקום לנהל שיחה על תמונות, המודל הזה מקבל תמונה יחידה והגדרה של שדות בפורמט YAML, ומחזיר אובייקט JSON תואם. הוא משלב מודל שפה של 1.2 מיליארד פרמטרים עם מקודד תמונה מסוג SigLIP2 בגודל של כ־400 מיליון פרמטרים, בארכיטקטורה היברידית של קונבולוציה ותשומת לב. הרעיון הוא לתת מענה צר ומדויק לחילוץ שדות, כולל אפשרות להגדיר ערכים מותרים מראש עבור כל שדה.

בבדיקה של 2,000 דגימות מול מודלים אחרים באזור ה־2 מיליארד פרמטרים, הוא הציג 99.6 אחוז בתקינות ה־JSON ועקביות הסכמה, לצד ציון שופט של 90.6. התוצאות האלה מראות שהוא כמעט לא שובר את המבנה המבוקש ומדייק בתוכן טוב יותר ממודלים כלליים בקטגוריית המשקל שלו, כשהוא מתקרב לביצועים של מודלים בגודל 4 מיליארד פרמטרים.

מתאים ל

  • תיוג מוצרים למסחר

    חילוץ תכונות כמו צבע, חומר ודוגמה ישירות לתוך שדות מוגדרים מראש עבור קטלוגים.

  • זיהוי אירועי בטיחות

    סריקת תמונות ממצלמות לאיתור נפילות, אש או דליפות והחזרת התראה במבנה נתונים קבוע.

  • איסוף נתונים מפריימים

    מעקב סטטיסטי אחרי עצמים ומאפיינים מתוך תמונות בודדות לצורך ניתוח במערכות המשך.

איפה זה נופל

המודל הזה לא מיועד לשיחות פתוחות, לשאלות ותשובות כלליות על תמונות או להשוואה בין מספר תמונות במקביל. הוא מוגדר עבור שפה אנגלית בלבד, כך שלא הייתי בונה עליו לחילוץ טקסט או תיאורים בעברית בלי לבדוק אותו ביסודיות קודם. בנוסף, המספרים הגבוהים במדדים הושגו אך ורק על המבנה המדויק של תמונה יחידה וסכמת YAML פשוטה, ולא יחזיקו במשימות ראייה מורכבות יותר.

אותה משפחה

LFM2.5-VL-1.6B-Extract יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בחילוץ נתונים בעברית?

המודל הוכרז ותועד עבור אנגלית בלבד. אם התמונות כוללות טקסט בעברית או שאתם דורשים ערכי פלט בעברית, סביר להניח שהתוצאות יהיו ירודות ועדיף לבחון חלופה שתומכת בשפה מראש.

האם אפשר להשתמש בו לצ'אט רגיל על תמונות?

לא, הוא אומן באופן ממוקד להחזיר JSON שטוח לפי הגדרת שדות ב־YAML, ולא לשיחה חופשית. למשימות שאלות ותשובות פתוחות עדיף לקחת מודל ראייה כללי.

איך מריצים

כדי להריץ אותו צריך ספריית transformers בגרסה 5.1 ומעלה יחד עם pillow. המשקל הכולל של הקבצים עומד על 3.1 גיגה בייט בפורמט bfloat16, כך שהוא נכנס בקלות לכרטיס מסך בסיסי עם 8 גיגה זיכרון, ואין שום הצדקה להחזיק שרת יקר או לשלם לספק ענן חיצוני לפי קריאה אם יש לכם נפח עבודה רציף.

ההרצה מיועדת לשיחה של סיבוב בודד בלבד. המפתחים ממליצים במפורש להשתמש ב־greedy decoding עם טמפרטורה אפס כדי לקבל פלט יציב ומדויק לפי הסכמה שהגדרתם.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="LiquidAI/LFM2.5-VL-1.6B-Extract")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־LFM Open License v1.0 ומסומן בקטלוג כ־other ולא כרישיון קוד פתוח סטנדרטי כמו MIT או Apache. המשמעות היא שאתם חייבים לקרוא את תנאי הרישיון הספציפיים של Liquid AI לפני שילוב שלו במוצר מסחרי, כדי לוודא שאין בו הגבלות על אופי השימוש, היקף המשתמשים או הפצה מסחרית.

הרישיון המלא בעמוד המודל ↗