GPT
O

Ovis2.6-30B-A3B

קוד פתוח

ATH-MaaSapache-2.02026-02-12

  • safetensors
  • ovis2_6_moe
  • image-text-to-text
  • conversational
  • custom_code

מודל ראייה ושפה שמחזיק 31 מיליארד פרמטרים אך מפעיל רק שלושה מיליארד בכל היסק. פתרון מתאים למי שרוצה ניתוח מסמכים ותמונות מורכבות בלי לשלם עלויות עיבוד של מודל ענק.

  • 31Bפרמטרים
  • 262,144טוקנים בהקשר
  • 58.5 GBמשקל הקבצים
  • 1,492הורדות בחודש

מה זה

מדובר במודל מולטימודלי המשלב טקסט, תמונה ווידאו. במקום לחשב את כל הרשת בכל מילה, ארכיטקטורת המומחים מפעילה רק שלושה מיליארד פרמטרים בפועל. המשמעות הישירה היא מהירות יצירה גבוהה יחסית לנפח הידע הכללי שהמודל מחזיק.

הוא מתמקד בפענוח מידע ויזואלי דחוס כמו תרשימים, קריאת טקסט מתמונות ושאילתות על גבי מסמכים ארוכים. המערכת כוללת מנגנון המכונה חשיבה עם תמונה, שבו המודל גוזר או מסובב אזורים בתמונה תוך כדי שרשרת החשיבה שלו, כדי לבחון פרטים קטנים לפני שהוא עונה. חלון ההקשר עומד על 64K טוקנים לפי התיאור או עד 262K לפי המפרט הטכני, והוא מקבל תמונות ברזולוציה של עד 2880 על 2880.

מתאים ל

  • ניתוח דוחות ותרשימים

    קריאת גרפים ומסמכים סרוקים ברזולוציה גבוהה של עד 2880x2880 ועיבוד נתונים מרובי עמודים.

  • איתור וסימון אובייקטים

    זיהוי פריטים בתמונה והחזרת נקודות ציון או תיחום מדויק בקואורדינטות לפי בקשה מוגדרת.

  • היסק ויזואלי מהיר

    מענה על שאלות חזותיות מורכבות בעלות חישוב נמוכה תודות להפעלת 3 מיליארד פרמטרים פעילים בלבד.

איפה זה נופל

למרות שזמן החישוב דומה למודל של 3B, עדיין צריך להחזיק את כל 58.5 הגיגה־בייט בזיכרון ה־GPU. בנוסף, מנגנון הזרמת התשובות שובר את המחלקות הרגילות של transformers ומחייב שימוש בקוד עזר ייעודי. היוצרים מציינים שהם אינם יכולים להבטיח שהתוכן נקי מהפרת זכויות יוצרים, ויש לתת למודל הנחיות קבועות ומדויקות כדי לחלץ תשובות משרשרת החשיבה שלו.

אותה משפחה

Ovis2.6 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס מסך ביתי בודד?

לא במשקלים המקוריים. הקבצים תופסים 58.5 גיגה־בייט ודורשים חלוקה בין מספר מאיצים גרפיים, כפי שמודגם בהרצה הרשמית על ארבעה כרטיסים.

מה היתרון של המודל לעומת מודל רגיל בגודל 30B?

הוא מציע מהירות תגובה ועלות חישוב של מודל קטן עם יכולת הבנה של מודל גדול, בזכות ניתוב של כ־3 מיליארד פרמטרים פעילים בכל רגע נתון.

איך מריצים

המודל דורש כ־58.5 גיגה־בייט רק כדי להטעין את המשקלים לזיכרון בפורמט bfloat16. כדי להריץ אותו דרך vLLM, דוגמת הקוד הרשמית מגדירה חלוקה לארבעה כרטיסי מסך, מה שאומר שתצטרכו שרת עם ארבעה מאיצים חזקים או שילוב מקביל כדי להתמודד עם הנפח.

הרצה מקומית דורשת תלויות ספציפיות כמו flash-attn והרצת קוד מותאם של הארכיטקטורה. אם אין לכם שרת ייעודי שפועל ברציפות, העלות של החזקת החומרה הזו בענן תהיה כבדה בהרבה משימוש בשירות מנוהל חיצוני.

pip install -U huggingface_hub
hf download ATH-MaaS/Ovis2.6-30B-A3B

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0. זהו רישיון פתוח שמתיר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או מסחרית בתוך מוצר, ללא תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗