GPT
L

LFM2-VL-3B

קוד פתוח

LiquidAIother2025-10-22

  • transformers
  • safetensors
  • lfm2_vl
  • image-text-to-text
  • liquid

מודל ראייה ושפה קומפקטי שמכוון לקצה ומאפשר לקבוע את כמות הטוקנים שהתמונה תתפוס. הוא שוקל 5.6 גיגה בייט ומתאים למי שחייב עיבוד תמונות מהיר מקומית בלי לנפח את הזיכרון.

  • 3Bפרמטרים
  • 128,000טוקנים בהקשר
  • 5.6 GBמשקל הקבצים
  • 2,363הורדות בחודש

מה זה

הארכיטקטורה משלבת מודל שפה של 2.6 מיליארד פרמטרים מסוג היברידי של קונבולוציה ותשומת לב, יחד עם אנקודר ראייה של 400 מיליון פרמטרים. תמונות עד 512 על 512 מעובדות ברזולוציה הטבעית שלהן ללא עיוות, בעוד תמונות גדולות יותר נחתכות לחלקים עם תמונת ממוזערת להקשר כללי. המערכת דוחסת את המידע החזותי כך שתמונה של אלף על שלושת אלפים פיקסלים למשל מתכווצת ל־1,020 טוקנים בלבד.

במדדים הוא מוביל בממוצע על מתחרים בגודל דומה כמו אינטרן וי אל וקוון 2.5, עם ציון ממוצע של 69. הפער המשמעותי נרשם במבחן הוראות המולטימודל שבו קיבל 51.83 נקודות לעומת פחות מ־40 אצל קוון ואינטרן, וגם בבדיקות הבנת תמונות מהעולם האמיתי הוא עקף אותם. בטקסט מתוך תמונה הוא הוציא 822 נקודות, תוצאה קרובה מאוד למתחרים אבל לא עוקפת אותם.

מתאים ל

  • סוכנים קלים בקצה

    הוא אומן למעקב אחרי פקודות וסוכנים, ונכנס בקלות לכרטיסי מסך קטנים עם פחות משישה גיגה זיכרון.

  • סריקת תמונות לא סטנדרטיות

    האנקודר שומר על יחסי גובה ורוחב חריגים ללא עיוות, ומתאים לפורמטים משתנים כמו פנורמות או צילומי מסמכים ארוכים.

  • איזון מהירות מול איכות

    אפשר להגביל ידנית בזמן ריצה את מספר טוקני התמונה בין 64 ל־256 בלי לאמן מחדש, לפי מגבלות החומרה.

איפה זה נופל

היוצרים כותבים במפורש שהמודל מיועד רק למשימות ממוקדות ודורש כוונון עדין כדי להגיע לביצועים טובים, ושאין להשתמש בו לקבלת החלטות קריטיות לבטיחות. בנוסף, אף שהמטא-דאטה מציין מספר שפות בינלאומיות, כרטיס המודל מגדיר תמיכה באנגלית בלבד. אם תזרקו עליו עברית בלי לאמן אותו מראש, התוצאות כנראה ישברו.

אותה משפחה

LFM2-VL יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין עברית?

הכרטיס הרשמי מציין במפורש תמיכה באנגלית בלבד, אף שבפרטי המאגר רשומות שפות נוספות. אין להסתמך עליו לעיבוד הוראות או תמונות בעברית ללא אימון נוסף.

למה צריך להתקין טרנספורמרס מהגיטהאב?

התמיכה בארכיטקטורת המודלים ההיברידית של ליקוויד עדיין חדשה ולא נכללת בגרסאות היציבות המבוגרות של הספרייה. התקנה מגרסת קומיט ספציפית נדרשת כדי שהמשקולות ייטענו ללא שגיאות.

האם הוא מתאים לזיהוי טקסט מתמונות?

הוא קיבל 822 במבחן הראייה הטקסטואלית, שזה ציון תחרותי לקטגוריית השלושה מיליארד פרמטרים. עם זאת, במבחן זה הוא מעט נמוך מאינטרן וי אל, ולכן למסמכים מורכבים במיוחד כדאי לבחון אותו מראש.

איך מריצים

אתם צריכים התקנה ישירה של ספריית הטרנספורמרס מהגיטהאב לפי קומיט ספציפי, כי התמיכה בארכיטקטורה עדיין לא בגרסה הרשמית היציבה. הקבצים שוקלים 5.6 גיגה בייט בפורמט בי פלואוט 16, כך שכרטיס מסך בסיסי עם 8 עד 12 גיגה זיכרון מריץ אותו בקלות. יש גם גרסאות קטנות יותר בסדרה, אחת של 450 מיליון ואחת של 1.6 מיליארד, שמיועדות לחומרה חלשה בהרבה.

אם יש לכם צורך בעיבוד רב לשוני מורכב או בטיפול במשימות כלליות כבדות, עדיף לפנות לשרת עם מודל ענק דרך ממשק חיצוני. המודל הזה משתלם כשאתם רוצים להריץ תהליכים ישירות על מכשיר קצה או לשלוט בדיוק על כמות טוקני התמונה לחיסכון בזמן.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="LiquidAI/LFM2-VL-3B")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון קנייני של החברה בשם LFM Open License v1.0, למרות שבמטא-דאטה מופיע רק סיווג כללי. הרישיון הזה אינו רישיון קוד פתוח סטנדרטי כמו אפאצ'י או MIT, ולכן לפני הטמעה במוצר מסחרי צריך לקרוא היטב את תנאי השימוש המדויקים שלהם כדי לוודא שאין הגבלות הפצה.

הרישיון המלא בעמוד המודל ↗