GPT
L

LLaVA-OneVision-1.5-8B-Instruct

קוד פתוח

lmms-labapache-2.02025-09-16

  • transformers
  • tensorboard
  • safetensors
  • feature-extraction
  • image-text-to-text

מודל ראייה ושפה פתוח עם 8.5 מיליארד פרמטרים שמתחרה ישירות ב־Qwen2.5-VL. מתאים למי שרוצה ניתוח תמונות ומסמכים ברזולוציה מקורית בלי תלות בשרתי ענן חיצוניים.

  • 8.5Bפרמטרים
  • 32,768טוקנים בהקשר
  • 16.0 GBמשקל הקבצים
  • 11,551הורדות בחודש

מה זה

מדובר במודל רב־מודאלי שמקבל תמונות וטקסט ומחזיר טקסט, עם חלון הקשר של 32,768 טוקנים שמאפשר לעבד מסמכים ארוכים או כמה תמונות ברצף. הוא אומן ישירות על תמונות ברזולוציה המקורית שלהן, מה שעוזר לו לקלוט פרטים קטנים בלי לחתוך או למרוח אותם מראש.

במבחני ביצועים מול Qwen2.5-VL 7B הוא מציג יתרון ברור במשימות מדעיות, תרשימים וניתוח מסמכים, עם 95.00 במבחן DocVQA ו־86.48 ב־ChartQA. מצד שני, במבחני OCR טהורים או שאלות חזותיות מורכבות ללא רמזי טקסט הוא מפגר מעט אחרי המתחרה, כך שהכוח העיקרי שלו הוא שילוב של הבנה תוכנית עם תמונה ולא סריקת תווים נטו.

מתאים ל

  • ניתוח תרשימים וגרפים

    התוצאה של 86.48 ב־ChartQA מוכיחה יכולת גבוהה לפענח גרפים ולהוציא מהם נתונים מדויקים.

  • חילוץ מידע ממסמכים

    עם ציון של 95.00 ב־DocVQA, המודל מתאים לעיבוד טפסים, חשבוניות ומסמכים מורכבים ברזולוציה גבוהה.

  • פתרון בעיות מדעיות חזותיות

    הציון 94.98 ב־ScienceQA מספק מענה מצוין לזיהוי והבנה של איורים מדעיים ותרשימי הסבר.

איפה זה נופל

למרות הביצועים הגבוהים במסמכים, במבחן OCRBench המודל קיבל 82.90 לעומת 84.20 של Qwen2.5-VL, ובמבחן InfoVQA הוא נופל לכיוון ה־78 לעומת מעל 81. במבחן MMMU-Pro שמבודד ראייה טהורה הוא השיג 25.15 בלבד לעומת 32.83, פער משמעותי שמראה שהוא מתקשה בהסקה חזותית מורכבת שאינה נשענת על טקסט בתמונה. בנוסף, נתוני הכרטיס אינם מציינים תמיכה או ביצועים בעברית, ולכן חובה לבדוק אותו עצמאית לפני הטמעה מקומית.

שאלות
נפוצות

איזה כרטיס מסך צריך כדי להריץ את המודל?

הקבצים שוקלים 16 גיגה־בייט בדיוק bfloat16. כדי לטעון אותם ולהשאיר מקום להקשר של עד 32 אלף טוקנים, תצטרכו כרטיס עם 24 גיגה־בייט זיכרון גרפי, כמו RTX 3090, RTX 4090 או A10.

במה הוא עדיף על פני Qwen2.5-VL 7B?

הוא מוביל בבירור במבחני מדע, ניתוח מסמכים ותרשימים כמו DocVQA ו־ChartQA. היתרון נובע בין היתר מאימון ישיר על תמונות ברזולוציה מקורית שמחדד את קליטת הפרטים.

איך מריצים

המשקלים תופסים 16 גיגה־בייט בפורמט bfloat16, כך שצריך כרטיס מסך עם לפחות 24 גיגה־בייט של זיכרון כמו RTX 3090 או RTX 4090 כדי להריץ אותו בלי קוונטיזציה. הקוד נשען על ספריית transformers יחד עם כלי העזר של qwen_vl_utils.

מי שמוגבל בחומרה יכול לפנות לגרסת ה־4B הקטנה יותר של אותה סדרה, שצורכת פחות משאבים. אם אין לכם שרת ייעודי או כרטיס מתאים בסביבה המקומית, עדיף להשתמש ב־API חיצוני או בפלטפורמות ענן לפי שעה, כי ניסיון להריץ 8.5 מיליארד פרמטרים על מעבד רגיל יספק קצב יצירה איטי מדי לשימוש מעשי.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="lmms-lab/LLaVA-OneVision-1.5-8B-Instruct")
print(pipe("שלום"))

הרישיון

המודל שוחרר ברישיון apache-2.0, רישיון קוד פתוח מתירני לחלוטין. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, ולשלב אותו במוצרים סגורים, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗