GPT
O

Ovis2-4B

קוד פתוח

ATH-MaaSapache-2.02025-02-10

  • transformers
  • safetensors
  • ovis
  • text-generation
  • MLLM

מודל ראייה ושפה קומפקטי שמצטיין בחילוץ טקסט מתמונות ודורש מעט משאבים. הוא משלב מודל שפה של 3 מיליארד פרמטרים עם רכיב ראייה כבד, כדי לספק דיוק גבוה בלי שרת ענק.

  • 4.6Bפרמטרים
  • 8.6 GBמשקל הקבצים
  • 12,363הורדות בחודש
  • 63לייקים

מה זה

מדובר במודל רב-מודאלי שמבוסס על שילוב בין רכיב הראייה aimv2-huge לבין מודל השפה Qwen2.5-3B-Instruct. המבנה שלו מתמקד בחיבור ישיר בין הייצוג הוויזואלי לייצוג הטקסטואלי, מה שמאפשר לו לעבד תמונות בודדות, רצפי תמונות וגם וידאו.

במבחני ביצועים הוא מציג נקודת חוזק ברורה במשימות פענוח טקסט. עם ציון של 91.1 ב־OCRBench, הוא עוקף מודלים גדולים ממנו כמו Qwen2.5-VL-7B ו־InternVL2.5-8B. גם ב־MathVista הוא מגיע ל־69.6 ועוקף חלופות בגודל דומה, מה שמראה יכולת טובה בניתוח תרשימים וגרפים.

מצד שני, הידע הכללי האקדמי שלו מוגבל יחסית לגודלו הכולל. במבחן MMMU הוא נעצר על 49.0, נמוך משמעותית ממודלים של 7 ו־8 מיליארד פרמטרים, כך שלא כדאי לבנות עליו להבנה מדעית עמוקה או לפתרון שאלות מורכבות ברמת אוניברסיטה.

מתאים ל

  • חילוץ נתונים ממסמכים

    הוא משיג 91.1 ב־OCRBench ומתאים במיוחד לקריאת קבלות, טפסים וטבלאות באנגלית.

  • ניתוח גרפים ותרשימים

    עם ציון 69.6 ב־MathVista הוא מסוגל לחלץ ערכים מתרשימים עסקיים ומדעיים קלים.

  • תיוג סרטונים קצרים

    הארכיטקטורה תומכת ברצפי פריימים ומאפשרת תיוג ויזואלי זול יחסית בחומרה מקומית.

איפה זה נופל

החולשה העיקרית היא תמיכה בשפות. המודל אומן רשמית על אנגלית וסינית בלבד, כך שפענוח תמונות בעברית או שיחה בעברית ייכשלו או יניבו תוצאות משובשות. בנוסף, המפתחים עצמם מציינים בראש העמוד שכבר קיימת גרסה חדשה יותר, Ovis2.5, ולכן כדאי לבדוק אותה לפני שמשקיעים זמן בהטמעה של גרסה 2.

במשימות של הבנה תפיסתית מורכבת וידע עולם הוא מוגבל. ציון של 53.0 ב־BLINK ו־53.8 ב־HallusionBench מעיד על נטייה להזיות וקושי בהשוואות ויזואליות דקות, כך שחובה להוסיף ולידציה על הפלטים ולא להסתמך עליו בעיניים עצומות.

אותה משפחה

Ovis2 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לשימוש בעברית?

לא. המודל הוגדר ואומן עבור אנגלית וסינית. הוא לא מיועד לקריאת מסמכים בעברית או לניהול שיחה תקינה בשפה, וכל ניסיון כזה יוביל לשגיאות או להזיות.

כמה זיכרון וידאו דרוש להרצה שלו בפועל?

המשקלים תופסים 8.6 ג'יגה-בייט, אבל עיבוד תמונות ברזולוציה גבוהה מעלה את צריכת הזיכרון. מומלץ להצטייד בכרטיס עם 16GB VRAM כדי לעבוד בצורה יציבה עם חלון הקשר מלא.

למה לבחור בו ולא בגרסת ה־8B?

אם החומרה שלכם מוגבלת לכרטיס מסך בודד של 16GB, גרסת ה־4B היא נקודת איזון מצוינת. היא שומרת על יכולות OCR שמתחרות בדגמים גדולים יותר בלי לדרוש שרת יקר.

איך מריצים

המשקל הכולל של הקבצים עומד על 8.6 ג'יגה-בייט בפורמט bfloat16. להרצה מקומית תצטרכו כרטיס מסך עם לפחות 12 עד 16 ג'יגה-בייט של זיכרון וידאו עבור המודל והקשר התמונה, יחד עם התקנה של PyTorch 2.4 ו־flash-attn. מי שמחזיק כרטיס כמו RTX 3060 או 4060 Ti עם 16GB יוכל להריץ אותו בלי בעיה.

אם אתם צריכים רק שאילתות בודדות או עיבוד מזדמן, עדיף להשתמש ב־API חיצוני במקום להחזיק שרת ייעודי בענן. הרצה עצמית שווה את המאמץ אם יש לכם צרכי פרטיות קפדניים, נפח תמונות גבוה שעלויות הקריאה עבורו יקרות, או כוונה לבצע אופטימיזציה מקומית דרך קוונטיזציה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="ATH-MaaS/Ovis2-4B")
print(pipe("שלום"))

הרישיון

רישיון Apache 2.0 מלא וחופשי. אתם יכולים להשתמש בו לצרכים מסחריים, לשנות את הקוד, לאמן עליו הלאה ולשלב אותו במוצר שלכם בלי לשלם תמלוגים. הדרישות היחידות הן שמירה על הודעת זכויות היוצרים וצירוף עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗