GPT
O

Ovis2.5-9B

קוד פתוח

ATH-MaaSapache-2.02025-08-15

  • transformers
  • safetensors
  • ovis2_5
  • text-generation
  • MLLM

מודל מולטימודלי פתוח שמנתח תמונות ברזולוציה מקורית בלי לחתוך אותן לחלקים קבועים. הוא משלב מנגנון חשיבה ובדיקה עצמית שמתאים במיוחד למסמכים צפופים ולתרשימים.

  • 9.2Bפרמטרים
  • 40,960טוקנים בהקשר
  • 17.1 GBמשקל הקבצים
  • 4,527הורדות בחודש

מה זה

הבסיס כאן הוא שילוב של רכיב ראייה מסוג NaViT יחד עם מודל שפה בגודל שמונה מיליארד פרמטרים ממשפחת Qwen3. במקום לדחוס כל תמונה לרשת ריבועית קבועה, הוא מעבד אותה ביחס המקורי שלה. הגישה הזו שומרת על פרטים קטנים ועל המבנה המרחבי, מה שעוזר מאוד בפענוח טבלאות, מסמכים סרוקים ותרשימים מורכבים.

חוץ מפענוח ויזואלי, הוסיפו לו מצב חשיבה שמאפשר למודל לבצע בדיקה עצמית ולתקן את עצמו לפני שהוא פולט תשובה סופית. במבחני OpenCompass המודל קיבל ציון ממוצע של 78.3, שמעמיד אותו בראש הקטגוריה של מודלים מולטימודליים פתוחים מתחת לארבעים מיליארד פרמטרים. בפועל זה אומר פחות הזיות על נתונים קטנים בתוך גרפים לעומת מודלים מקבילים בגודל הזה.

מתאים ל

  • חילוץ מידע מדוחות וגרפים

    עיבוד תמונות ללא חיתוך מאפשר קריאה מדויקת של ערכים מתוך תרשימים וטבלאות צפופות באנגלית.

  • איתור אובייקטים לפי טקסט

    המודל מחזיר קואורדינטות מדויקות של תיחום ונקודות עבור עצמים שמוגדרים בשאילתה.

  • ניתוח וידאו מבוסס פריימים

    חלון הקשר של כארבעים אלף טוקנים מתאים להזנה של רצף פריימים והבנת ההתרחשות לאורך זמן.

איפה זה נופל

המודל אומן ותומך רשמית רק באנגלית ובסינית, כך שאין לצפות לביצועים סבירים בעברית, בין אם בטקסט החופשי ובין אם בזיהוי תווים מתוך מסמכים מקומיים. בנוסף, מנגנון החשיבה המעמיק דורש תקציב טוקנים ייעודי ומעלה משמעותית את זמן התגובה. החוקרים עצמם מודים בפירוש שהם לא יכולים להבטיח היעדר בעיות של זכויות יוצרים או פליטת תוכן לא הולם בגלל מורכבות המידע באימון.

אותה משפחה

Ovis2.5 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לפענוח חשבוניות ומסמכים בעברית?

לא. התמיכה המוכרזת של המודל היא באנגלית ובסינית בלבד. הוא ייכשל בפענוח פונטים בעברית או בניתוח טקסט מימין לשמאל.

איך מחלצים ממנו תשובה סופית כשמפעילים מצב חשיבה?

המפתחים ממליצים להוסיף לפרומפט הנחיה לסיים במחרוזת קבועה של תשובה סופית. בנוסף, בגלל מבנה החשיבה, חייבים להשתמש במחלקת הזרמה מותאמת אישית ולא בזו הרגילה של transformers.

האם אפשר להריץ אותו בצורה מהירה יותר עם vLLM?

כן, המפתחים מפנים לעמוד הגיטהאב של הפרויקט להסבר על הרצה מואצת דרך vLLM. זה מומלץ במיוחד אם רוצים לקצר את זמני ההסקה בעבודה שוטפת.

איך מריצים

המשקלים שוקלים מעל 17 גיגהבייט בפורמט bfloat16, כך שתצטרכו כרטיס מסך עם לפחות 24 גיגהבייט זיכרון כמו RTX 3090 או A10G כדי לטעון אותו ולהריץ הסקת מסקנות בסיסית. לחלון הקשר מלא שמגיע עד כארבעים אלף טוקנים, או לעיבוד וידאו ומספר תמונות במקביל, כרטיס בודד כזה ייחנק ותצטרכו A100 או שימוש בגרסת ה־2B הקלה יותר.

הקוד דורש גרסאות ספציפיות מאוד של ספריות כמו transformers 4.51.3 ו־flash-attn 2.7.0. אם אתם צריכים רק שאילתות בודדות של תמונות פשוטות בלי לנהל תלויות תוכנה רגישות וחומרה יקרה, פנייה ל־API מסחרי מוכן תחסוך לכם הרבה התעסקות.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="ATH-MaaS/Ovis2.5-9B")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו חופשי לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר סגור, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקוריים של המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗