GPT
O

Ovis2.5-2B

קוד פתוח

ATH-MaaSapache-2.02025-08-15

  • transformers
  • safetensors
  • ovis2_5
  • text-generation
  • MLLM

מודל ראייה ושפה קטן של 2.6 מיליארד פרמטרים שמעבד תמונות ברזולוציה המקורית שלהן. הוא מביא יכולות הסקה ובדיקה עצמית בלי הדרישה לכרטיסי מסך כבדים.

  • 2.6Bפרמטרים
  • 40,960טוקנים בהקשר
  • 4.8 GBמשקל הקבצים
  • 3,069הורדות בחודש

מה זה

המודל משלב את מקודד התמונות siglip2-so400m יחד עם מודל השפה Qwen3-1.7B, ומיועד למשימות משולבות של טקסט ותמונה. במקום לחתוך תמונות לגודל קבוע מראש, הוא משתמש ברשת NaViT שמתמודדת עם הרזולוציה הטבעית של הקובץ. המבנה הזה שומר על פרטים קטנים ועל המבנה המרחבי, מה שעוזר לו מאוד בפענוח מסמכים צפופים, גרפים, טבלאות וזיהוי טקסט מתמונות.

בנוסף לניתוח חזותי רגיל, אימנו אותו על הסקה רפלקטיבית שכוללת בדיקה עצמית ותיקון שגיאות תוך כדי פעולה. במבחני OpenCompass המודל הוציא ציון ממוצע של 73.9, שזה נתון גבוה מאוד לגודל של 2 מיליארד פרמטרים ומתקרב לביצועים של מודלים פתוחים כבדים ממנו בהרבה. הוא תומך גם בניתוח וידאו מרובה פריימים, קלט של כמה תמונות במקביל, וסימון אובייקטים במרחב לפי נקודות ותיבות תוחמות.

מתאים ל

  • חילוץ נתונים מדוחות

    קריאת גרפים מורכבים וטבלאות צפופות ברזולוציה מקורית בלי לאבד מספרים קטנים בגלל חיתוך תמונה.

  • איתור עצמים במרחב התמונה

    קבלת קואורדינטות מדויקות של אובייקטים לפי הנחיה טקסטואלית באמצעות מנגנון התיבות התוחמות המובנה.

  • ניתוח רצפי וידאו מקומית

    מעקב אחר רצף פריימים מתוך סרטונים על גבי כרטיס מסך בודד וזול בלי להוציא מדיה לשרתים חיצוניים.

איפה זה נופל

השפות הנתמכות לפי המפרט הן אנגלית וסינית בלבד, כך שאין כאן תמיכה מובנית בעברית, לא בטקסט הקלט ולא בזיהוי תווים מקומיים. מעבר לזה, מצב החשיבה המעמיק מעלה את זמן התגובה בצורה מורגשת, מה שלא מתאים למערכות שדורשות מענה מיידי בזמן אמת. המפתחים עצמם מבהירים שהאימון עבר בדיקות תאימות אוטומטיות אך הם לא מתחייבים להיעדר בעיות זכויות יוצרים או תוכן לא הולם, מה שמחייב בדיקות סינון לפני חיבור למשתמשי קצה.

אותה משפחה

Ovis2.5 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לפענוח מסמכים וחשבוניות בעברית?

המודל אומן רשמית רק על אנגלית וסינית. הוא כנראה ייכשל בקריאת טקסט עברי מתמונות או בהבנת שאלות בעברית, ולכן למסמכים מקומיים תצטרכו מודל אחר או כלי OCR ייעודי לפניו.

מה דורש מנגנון החשיבה בזמן ההרצה?

המנגנון מאפשר להגדיר תקציב טוקנים להסקה ובדיקה עצמית של התשובה. זה מייצר דיוק גבוה יותר בחישובים וקריאת גרפים, אבל מאריך את זמן ההפקה ודורש מחלקת הזרמה מיוחדת בקוד במקום ברירת המחדל.

איך מריצים

כדי להריץ אותו צריך סביבת פייתון עם PyTorch 2.4.0, ספריית transformers בגרסה 4.51.3 לפחות, ותמיכה ב־flash-attn להאצה. כל המשקלים יושבים על 4.8 גיגה בייט בדיוק bfloat16, כך שכרטיס מסך צרכני פשוט עם 8 עד 12 גיגה זיכרון מריץ אותו מקומית בלי שום בעיה. המפתחים מציעים גם שימוש ב־vLLM כדי לייעל את קצב הריצה בתעבורה גבוהה.

מי שרוצה יותר דיוק יכול להפעיל את מצב החשיבה המובנה, שבו מגדירים תקציב טוקנים למחשבה לפני התשובה הסופית. השימוש במצב הזה דורש מחלקה מותאמת להזרמת טקסט שהמפתחים מספקים, כי מנגנון הזרימה הרגיל של Hugging Face לא עובד איתו ישירות. אם המערכת שלכם צריכה רק לפענח תמונות בודדות פעם בשעה, קריאה למודל דרך שירות ענן תחסוך תחזוקה, אבל בנפחי עבודה רציפים החומרה הזולה הופכת הרצה עצמית למשתלמת מאוד.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="ATH-MaaS/Ovis2.5-2B")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש במודל לפרויקטים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצר סגור או פתוח, בתנאי ששומרים על הודעת זכויות היוצרים המקורית והצהרת הוויתור. אין כאן הגבלות שימוש מסחריות או תמלוגים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗