GPT
L

LFM2.5-VL-1.6B

קוד פתוח

LiquidAIother2026-01-05

  • transformers
  • safetensors
  • lfm2_vl
  • image-text-to-text
  • liquid

מודל ראייה ושפה קומפקטי שרץ בקלות מקומית ומציע חילוץ טקסט וניתוח תמונות באיכות טובה, בלי לטחון זיכרון או לדרוש שרת ייעודי.

  • 1.6Bפרמטרים
  • 128,000טוקנים בהקשר
  • 3.0 GBמשקל הקבצים
  • 231,023הורדות בחודש

מה זה

מדובר במודל רב מודאלי של חברת Liquid AI שמחבר מודל שפה של 1.2 מיליארד פרמטרים עם רכיב ראייה SigLIP2 בגודל 400 מיליון פרמטרים. הוא תומך בכמה תמונות במקביל, שומר על יחסי גובה רוחב בלי לעוות פרטים, ומשתמש בשיטת חלוקה למקטעים של 512 על 512 פיקסלים שמאפשרת לו להתמודד יפה עם רזולוציות גבוהות. מבחינת שפות, הרשימה הרשמית כוללת אנגלית, ערבית, סינית, צרפתית, גרמנית, יפנית, קוריאנית וספרדית. עברית אינה מופיעה ברשימה, ולכן אי אפשר לבנות עליו להבנה או לפלט בעברית בלי אימון ייעודי.

במבחני ביצועים מול מתחרים באותו סדר גודל כמו InternVL3.5 ו־FastVLM, הוא מציג יתרון בולט בהבנת הוראות מורכבות, עם ציון 52.29 ב־MM-IFEval לעומת ציונים סביב ה־30 אצל האחרים. גם בחילוץ טקסט מתמונות הוא מגיע ל־41.44 ב־OCRBench, מה שאומר שהוא מתמודד טוב משמעותית עם מסמכים וטקסט חזותי מאשר דגמים מקבילים. היתרון הגדול שלו מגיע משליטה בכמות הטוקנים שהתמונה צורכת בזמן ריצה, כך שאתם מחליטים מתי להעדיף מהירות ומתי דיוק.

מתאים ל

  • חילוץ נתונים ממסמכים וקבלות

    התוצאה ב־OCRBench הופכת אותו למתאים לקריאת טקסט מקומי, חשבוניות ומסמכים סרוקים ישירות במכשיר.

  • כתוביות לווידאו במכשירי קצה

    הארכיטקטורה הקלה מאפשרת פענוח מהיר של פריימים בזמן אמת בלי לחנוק את המעבד או לדרוש חיבור לענן.

  • סיווג תמונות באפליקציות מובייל

    זמינות גרסאות ONNX ו־MLX מקלה על הטמעה מהירה במכשירים ניידים עם צריכת זיכרון מינימלית.

איפה זה נופל

היוצרים מציינים בפירוש שהמודל לא מתאים למשימות עתירות ידע. בציון MMMU של 40.56 אפשר לראות שהוא מתקשה בעובדות מורכבות, בידע אקדמי או בהסבר תופעות שדורשות רקע רחב. תמיכה בקריאת פונקציות קיימת רק עבור טקסט רגיל, כך שאי אפשר לבקש ממנו להפעיל כלים ישירות מתוך ניתוח של תמונה. חוסר התמיכה הרשמי בעברית מחייב בדיקה קפדנית אם הממשק שלכם מיועד למשתמשים מקומיים.

אותה משפחה

LFM2.5-VL יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר לסמוך עליו לקריאת מסמכים בעברית?

עברית אינה ברשימת השפות הנתמכות של המודל, והוא אומן בעיקר על אנגלית, שפות אירופיות, ערבית ושפות אסייתיות. הוא עלול לזהות אותיות בודדות בגלל יכולות ה־OCR, אבל צפוי לטעות בסדר המילים ובמשמעות. לשימוש רציני בעברית תצטרכו לאמן אותו מחדש.

איזה כרטיס מסך נדרש כדי להריץ את המודל?

המשקל שלו הוא כשלושה גיגה בייט בלבד, כך שכרטיס מסך פשוט עם 6 עד 8 גיגה בייט של VRAM יריץ אותו בקלות. אם משתמשים בגרסאות המכווצות כמו GGUF דרך llama.cpp, אפשר להריץ אותו אפילו על זיכרון המחשב הרגיל ללא כרטיס מסך ייעודי.

איך מריצים

במשקל כולל של כשלושה גיגה בייט, המודל הזה מתאים לריצה כמעט בכל מקום. תוכלו להריץ אותו דרך ספריית transformers הרגילה, אבל קיימות גם גרסאות GGUF שמתאימות לריצה קלה על המעבד דרך llama.cpp, גרסת ONNX לחומרה מגוונת וגרסת MLX שמנצלת מעבדי אפל בצורה מעולה. כל לפטופ מודרני או כרטיס מסך ביתי בסיסי יריצו אותו בלי מאמץ.

אם כל מה שאתם צריכים זה לנתח תמונה אחת פעם בכמה שעות, עדיף להשתמש ב־API קיים של מודל ענן חזק ולא להחזיק תשתית. הריצה המקומית של הדגם הזה משתלמת ברגע שרוצים לעבד זרם וידאו רציף, לשמור על פרטיות מוחלטת של תמונות, או לעבוד על מכשירי קצה ללא חיבור רשת.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="LiquidAI/LFM2.5-VL-1.6B")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other, כלומר רישיון מותאם אישית של Liquid AI ולא קוד פתוח מוכר וסטנדרטי. אם אתם מתכננים לשלב אותו במוצר מסחרי, חובה לקרוא את קובץ הרישיון המדויק במאגר כדי לוודא שאין הגבלות שימוש, איסור על מסחור או דרישה לחלוקת רווחים.

הרישיון המלא בעמוד המודל ↗