GPT
O

Ovis-U1-3B

קוד פתוח

ATH-MaaSapache-2.02025-06-28

  • transformers
  • safetensors
  • ovis_u1
  • text-generation
  • image-text-to-text

המודל הזה מאחד הבנת תמונות, יצירת תמונות ועריכה גרפית בתוך משקל קטן יחסית. הוא מתאים למי שרוצה לעשות הכל במקום אחד בלי לשרשר מודלים שונים.

  • 3.6Bפרמטרים
  • 9.6 GBמשקל הקבצים
  • 914הורדות בחודש
  • 214לייקים

מה זה

מדובר במודל שמשלב שלוש משימות שנפרדות בדרך כלל: הבנת תמונה בודדת או רצף תמונות, יצירת תמונה מטקסט, ועריכת תמונה לפי פקודה. במקום להחזיק מודל שפה ויזואלי ולצידו מודל דיפוזיה נפרד, הארכיטקטורה כאן מרכזת את כל הפעולות באותו שלד של 3.6 מיליארד פרמטרים. הבסיס נשען על פיתוחים קודמים של Ovis ומשלב עקרונות מספרית FLUX ליצירת התמונות.

במדדי ביצועים הוא מציג מספרים תחרותיים לקטגוריה שלו. במבחן GenEval ליצירת תמונות הוא הגיע לציון 0.89 ועקף מודלים ייעודיים, בעיקר בזכות דיוק בהבנת מיקומים ויחסים בין שני עצמים. גם בעריכת תמונה במבחן ImgEdit-Bench הוא הגיע לציון כולל של 4.00, שקרוב מאוד לרמה של GPT-4o, עם תוצאות חזקות בהסרת אובייקטים והחלפתם. בהבנת תמונה כללית הוא עומד על ממוצע 69.6 במבחני OpenCompass, ציון סביר לגודלו אך נמוך ממודלי ענק.

מתאים ל

  • עריכת תמונות מונחית שפה

    החלפת אובייקטים ושינוי רקעים לפי פקודת טקסט, תחום שבו הוא עוקף את רוב המודלים הפתוחים בגודל שלו.

  • ניתוח מסמכים ותרשימים

    ציון של 88.3 במבחן OCRBench מאפשר חילוץ פרטים וטקסט מתמונות בצורה אמינה יחסית.

  • יצירת תמונות מרובות עצמים

    הוא מדייק במיקום של מספר אובייקטים ויחסי גודל ביניהם לפי מבחני GenEval.

איפה זה נופל

במבחן GEdit-Bench-EN לשינוי טקסט בתוך תמונה הוא קיבל ציון נמוך של 4.482, כך שלא כדאי לבנות עליו לעריכת שלטים או טיפוגרפיה. בנוסף, הוא אומן באנגלית בלבד ולכן לא יבין הוראות בעברית, וקצב יצירת התמונה דורש 50 צעדים, מה שיוצר זמני תגובה איטיים ביחס למודלים מהירים שקיימים כיום.

שאלות
נפוצות

האם המודל מבין הוראות בעברית?

לא, המודל אומן ותועד עבור השפה האנגלית בלבד. אם תשלחו לו הנחיות בעברית תיתקלו בשגיאות הבנה או בתשובות שבורות, ולכן חובה לתרגם את הקלט לאנגלית לפני הפנייה אליו.

כמה זיכרון גרפי נדרש בשביל להריץ אותו?

הקבצים עצמם שוקלים 9.6 גיגה בייט בדיוק bfloat16. להרצת הבנת טקסט בלבד אפשר להסתפק בכרטיס של 16 גיגה בייט, אך ליצירת תמונות ברזולוציה של 1024 על 1024 עם DeepSpeed תצטרכו כרטיס עם 24 גיגה בייט VRAM לפחות.

איך מריצים

כדי להריץ אותו צריך להתקין את הקוד מהמאגר בגיטהאב יחד עם סביבת פייתון 3.10, PyTorch 2.4.0, Transformers וספריית DeepSpeed. המודל שוקל 9.6 גיגה בייט בקבצי bfloat16, כך שתצטרכו כרטיס מסך עם לפחות 16 עד 24 גיגה בייט של VRAM כדי לטעון אותו ולבצע הסקה בלי לקרוס, במיוחד כשמייצרים תמונות ברזולוציה של 1024 על 1024 בחמישים צעדים.

אם אתם צריכים רק עריכת תמונה מזדמנת או שאין לכם חומרה ייעודית בענן, עדיף להשתמש ב־API חיצוני של מודלים מבוססים. הרצה עצמית כאן משתלמת רק אם אתם חייבים לשמור על המידע מקומית או בונים פיצ'ר שמשלב ניתוח ויצירה ברצף מהיר.

from transformers import pipeline

pipe = pipeline("any-to-any", model="ATH-MaaS/Ovis-U1-3B")
print(pipe("שלום"))

הרישיון

הפרויקט משוחרר תחת רישיון Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר, בתנאי ששומרים על הצהרת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗