GPT
O

Ovis2-1B

קוד פתוח

ATH-MaaSapache-2.02025-02-10

  • transformers
  • safetensors
  • ovis
  • text-generation
  • MLLM

מודל ראייה ושפה קטן במיוחד שרץ כמעט על כל חומרה. הוא מתאים למי שרוצה זיהוי טקסט ותמונות מקומי בלי לגעת בשרתים כבדים.

  • 1.3Bפרמטרים
  • 2.4 GBמשקל הקבצים
  • 16,557הורדות בחודש
  • 97לייקים

מה זה

מדובר במודל מולטימודלי זעיר המשלב בין רכיב הראייה aimv2-large לבין מודל הטקסט Qwen2.5-0.5B. השילוב הזה נועד ליישר ייצוגים ויזואליים וטקסטואליים ישירות בארכיטקטורה, עם תמיכה בעיבוד תמונות בודדות, מספר תמונות במקביל ואפילו וידאו.

היתרון הבולט שלו הוא קריאת טקסט. במבחן OCRBench הוא קיבל ציון 89.0, תוצאה שעוקפת אפילו את הגרסאות הגדולות יותר בסדרה כמו Ovis2-2B ואת Qwen2.5-VL-3B. הוא גם מוציא 59.4 ב־MathVista, כך שיש לו יכולת סבירה בניתוח תרשימים ובעיות ויזואליות פשוטות.

מצד שני, היכולות המילוליות הכלליות שלו מוגבלות מאוד בגלל מודל הבסיס הקטן. במבחנים רחבים כמו MMMU הוא מקבל רק 36.1, מה שאומר שהוא מתאים למשימות ממוקדות של חילוץ מידע ולא לשיחה חופשית או ניתוח מעמיק.

מתאים ל

  • חילוץ טקסט מטפסים

    תוצאת ה־OCRBench הגבוהה הופכת אותו למעולה בקריאת חשבוניות ותרשימים מקומית.

  • סריקת תמונות במכשירי קצה

    משקל של 2.4 גיגה בייט מאפשר לו לרוץ על מחשבים ניידים פשוטים וחומרה זולה ללא רשת.

  • סינון ראשוני של מסמכים

    הוא מזהה נוכחות של אלמנטים וטקסט בסיסי במהירות גבוהה לפני שליחה למודל כבד יותר.

איפה זה נופל

היוצרים מציינים במפורש שהם אינם יכולים להבטיח היעדר בעיות זכויות יוצרים או תוכן לא הולם בנתוני האימון. במבחני וידאו כמו VideoMME הוא מגיע לציון של 48.6 בלבד, ואינו מחזיק הקשר לאורך זמן. בנוסף, המודל מוגדר רשמית לאנגלית ולסינית בלבד. אין תמיכה מובנית בעברית, ולמרות השיפור בראייה, הוא נוטה להיכשל בהבנת הקשרים מורכבים בגלל מוח טקסטואלי זעיר של חצי מיליארד פרמטרים.

אותה משפחה

Ovis2 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

הכרטיס מגדיר תמיכה רשמית באנגלית ובסינית בלבד. הוא מסוגל אולי לזהות אותיות עבריות מסוימות בגלל שיפורי הראייה, אבל יכולת הפקת הטקסט והמענה בעברית מוגבלת מאוד ולא מיועדת לכך.

למה לבחור בו ולא בגרסת 2B או 4B?

הסיבה העיקרית היא חיסכון קיצוני במשאבים וביצועי קריאת טקסט נקודתיים. במבחן OCRBench דגם ה־1B עוקף את הדגמים הגדולים יותר בסדרה, ולכן אם המשימה היא רק חילוץ טקסט מתמונה, הוא יעשה עבודה טובה יותר בפחות זיכרון.

איך מריצים

המשקל הכולל של הקבצים עומד על 2.4 גיגה בייט בלבד, מה שמאפשר להריץ אותו בקלות על מעבד גרפי ביתי פשוט, ואפילו על כרטיסי מסך ישנים עם מעט זיכרון. ההתקנה דורשת את ספריית transformers יחד עם torch בגרסה 2.4.0 וממליצה על flash-attn לשיפור מהירות הריצה.

המפרסמים עצמם ממליצים להשתמש בגרסה החדשה יותר, Ovis2.5, כך שאם אתם מתחילים פרויקט חדש כדאי לבדוק אותה קודם. להרצה מקומית המודל הזה אידיאלי מבחינת עלויות, אך אם המטרה היא ניתוח מורכב של סרטונים ארוכים, כדאי לשקול פנייה למודל גדול יותר דרך ממשק חיצוני במקום להתאמץ על דיוק נמוך.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="ATH-MaaS/Ovis2-1B")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או חיצונית בתוך מוצרים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים המקורית והצהרת שינויים אם נעשו כאלה, ללא דרישה לחשוף את הקוד של המוצר שבו המודל מוטמע.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗