GPT
L

LFM2-VL-450M

קוד פתוח

LiquidAIother2025-08-12

  • transformers
  • safetensors
  • lfm2_vl
  • image-text-to-text
  • liquid

מודל ראייה ושפה זעיר שרץ ישירות על חומרת קצה בלי לדרוש שרת ייעודי. הוא שוקל פחות מגיגהבייט ומכוון לעיבוד תמונות מהיר במיוחד במכשירים מוגבלים.

  • 451Mפרמטרים
  • 128,000טוקנים בהקשר
  • 865 MBמשקל הקבצים
  • 15,113הורדות בחודש

מה זה

מדובר בשילוב בין מודל שפה של 350 מיליון פרמטרים לחלק ויזואלי מסוג SigLIP2 NaFlex של 86 מיליון פרמטרים. הארכיטקטורה משלבת שכבות קונבולוציה ותשומת לב, במטרה לחתוך את זמני הריצה בחצי לעומת מודלי ראייה קיימים. הוא מעבד תמונות ברזולוציה מקורית עד 512 על 512 ללא עיוות, וחותך תמונות גדולות יותר למקטעים תוך שליטה במספר הטוקנים שנוצרים בזמן אמת.

במבחני הביצועים מול SmolVLM2 בגודל דומה, הוא מציג יתרון ברור במשימות מעשיות. בבדיקת מעקב אחר הוראות בתמונה הוא הגיע לציון 33.09 לעומת 11.27 של המתחרה, וחילץ מידע מגרפים ומסמכים בציון 44.56 לעומת 24.64. עם זאת, במבחן MME הכללי הוא קיבל 1229.91 לעומת 1448.30, מה שמראה שהידע הכללי הרחב שלו מוגבל מאוד.

מתאים ל

  • זיהוי טקסט מהיר על הקצה

    שליפת נתונים מתמונות ומסמכים קטנים ישירות בחומרה מוגבלת, בזכות ציון OCRBench שעומד על 657 נקודות.

  • סוכנים רובוטיים פשוטים

    מעקב אחר הוראות מבוססות ראייה בזמן אמת, תחום שבו הוא מציג 33.09 נקודות במבחן MM-IFEval.

  • מיון תמונות במכשיר ללא רשת

    סיווג ויזואלי מהיר של צילומים מקומיים במכשירים שחייבים לפעול באופן מנותק ובמשקל זיכרון של פחות מגיגהבייט.

איפה זה נופל

היוצרים שלו מבהירים מראש שהוא לא מיועד לקבלת החלטות קריטיות מבחינת בטיחות. הידע הכללי שלו באנגלית נמוך יחסית, עם ציון 40.16 בלבד במבחן MMLU, ובמבחן ההבנה הרב־תחומית MMMU הוא עומד על 34.44. תמיכה בעברית אינה קיימת כלל לפי המפרט, שכולל אנגלית בלבד. בנוסף, הוא אינו כולל את מנגנון תמונות התצוגה המקדימה שקיים בגרסת ה־1.6B, כך שקשה לו להבין את ההקשר הרחב של תמונות ענקיות שפורקו להרבה מקטעים. מי שבונה עליו חייב לאמן אותו נקודתית על משימה מוגדרת היטב ולא לצפות לתשובות פתוחות חכמות.

אותה משפחה

LFM2-VL יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין פקודות או טקסט בעברית?

לא. המודל אומן ותומך רשמית בשפה האנגלית בלבד. ניסיון להזין לו הנחיות בעברית או לבקש ניתוח טקסט עברי בתוך תמונה יוביל לפלט משובש לחלוטין.

האם אפשר להשתמש בו ישירות מהקופסה בלי אימון נוסף?

החברה מציינת בפירוש שבגלל גודלו הזעיר, מומלץ לבצע כוונון עדין על משימה מוגדרת וצרה כדי להפיק ממנו ערך אמיתי. למשימות שיחה כלליות או הבנה רחבה הוא מוגבל מדי.

איך שולטים על היחס בין מהירות העיבוד לדיוק התמונה?

בזמן הקריאה למודל אפשר להגדיר ידנית את כמות טוקני התמונה המינימלית והמקסימלית, למשל בין 64 ל־256 טוקנים. ככל שבוחרים פחות טוקנים, העיבוד מהיר בהרבה אך יורד בפירוט.

איך מריצים

המשקל הכולל של הקבצים עומד על 865 מגהבייט בדיוק בפורמט bfloat16. זה אומר שאפשר להריץ אותו כמעט על כל מעבד גרפי בסיסי, כרטיס מובנה או מחשב לוח כמו רספברי פאי, בלי לפגוש בעיות זיכרון. ההרצה נעשית דרך ספריית transformers הרגילה מגרסה 4.57 ומעלה יחד עם pillow.

אם אתם שוקלים להריץ אותו בשרת ענן חזק בשביל אפליקציה כללית, חבל על המאמץ. במחירים של היום עדיף לקרוא ל־API חיצוני של מודל גדול, שייתן הבנה עמוקה בהרבה. המודל הזה שווה את ההרצה העצמית אך ורק כשחייבים עיבוד מקומי על המכשיר עצמו ללא חיבור רשת או בזמני תגובה אפסיים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="LiquidAI/LFM2-VL-450M")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים מופצים תחת רישיון שנקרא LFM Open License v1.0, שמוגדר במערכת כרישיון מותאם אישית. הוא אינו רישיון קוד פתוח סטנדרטי כמו MIT או אפאצ'י. מי שמתכנן להטמיע את המודל במוצר מסחרי חייב לקרוא בעיון את תנאי הרישיון של החברה לפני ההפצה כדי לבדוק הגבלות מסחריות ושימוש.

הרישיון המלא בעמוד המודל ↗