GPT
O

Ovis-Image-7B

קוד פתוח

ATH-MaaSapache-2.02025-11-28

  • diffusers
  • safetensors
  • image generation
  • text-to-image
  • en

מודל תמונה שמיועד ספציפית לרינדור טקסט מדויק באנגלית ובסינית, בלי לדרוש אשכול שרתים ענק כדי לעבוד.

  • 7.4Bפרמטרים
  • 52.9 GBמשקל הקבצים
  • 915הורדות בחודש
  • 207לייקים

מה זה

מדובר במודל יצירת תמונה מטקסט בהיקף של 7.4 מיליארד פרמטרים, שמבוסס על שילוב של ארכיטקטורת Ovis עם רכיבים מ־FLUX. המטרה המרכזית שלו היא לפתור את אחת הבעיות המעיקות בתחום, כתיבת אותיות ומילים קריאות ונכונות בתוך התמונה עצמה, בלי עיוותים ובלי שגיאות כתיב מביכות.

במבחני ביצועים שמודדים רינדור טקסט מרובה אזורים כמו CVTG-2K, הוא מגיע לדיוק ממוצע של 0.9200, תוצאה שעוקפת מודלים גדולים בהרבה כמו Qwen-Image ו־GPT4o. במדדי תמונה כלליים כמו GenEval הוא עומד על ציון כולל של 0.84, כך שהוא שומר על איכות ויזואלית סבירה, אבל היתרון האמיתי מורגש רק כשהפרומפט שלכם כולל טיפוגרפיה, שלטים או ממשקים.

מתאים ל

  • עיצוב כרזות ובאנרים

    יצירת חומרים שיווקיים שמשלבים כותרות וטקסט קריא באנגלית בלי צורך להדביק אותם אחר כך בפוטושופ.

  • מוקאפים לממשקי משתמש

    הפקת רעיונות ל־UI ואינפוגרפיקה שבהם הטקסט בתוך הכפתורים והתפריטים צריך להיות ברור ומיושר.

  • לוגואים מבוססי טיפוגרפיה

    יצירת סמלילים שדורשים שילוב מדויק בין סגנון אמנותי לבין כתיב נכון של שם המותג.

איפה זה נופל

התמיכה מוגבלת לאנגלית ולסינית בלבד, כך שטקסט בעברית פשוט לא יעבוד. בנוסף, במבחן GenEval הוא קיבל ציון נמוך של 0.67 במיקום יחסי של אובייקטים ו־0.76 בספירה, מה שאומר שהוא מתקשה בהבנת יחסים מרחביים מורכבים. במבחן הגיוון של OneIG-EN הוא קיבל רק 0.186, כך שהסגנון הוויזואלי שלו נוטה לחזור על עצמו.

שאלות
נפוצות

האם המודל תומך ביצירת טקסט בעברית בתוך התמונה?

לא. המודל אומן והוגדר רשמית עבור אנגלית וסינית בלבד. ניסיון לבקש מילים בעברית יפיק כיתובים משובשים ולא קריאים.

איזה כרטיס מסך נדרש כדי להריץ אותו מקומית?

בגלל ארכיטקטורה של 7.4 מיליארד פרמטרים וקבצים בנפח של מעל 50 גיגה, תצטרכו כרטיס מסך ברמת RTX 3090, RTX 4090 או כרטיס שרת עם לפחות 24GB זיכרון ייעודי כדי לעבוד ב־bfloat16 בצורה יציבה.

האם הוא מתאים ליצירת תמונות כלליות ללא טקסט?

הוא מייצר תמונות טובות ברזולוציה של 1024, אך היתרון העיקרי שלו מול חלופות קיימות הוא רינדור האותיות. במשימות כלליות שאין בהן טקסט, יש מודלים מגוונים יותר שדורשים פחות משאבים.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־52.9 גיגה־בייט, כך שתצטרכו שטח אחסון נכבד וכרטיס מסך מודרני עם לפחות 16 עד 24 גיגה זיכרון כדי להריץ אותו מקומית ב־bfloat16. הוא נתמך ישירות בספריית diffusers מגרסה 0.36 ומעלה באמצעות OvisImagePipeline, או בריצה ישירה מסקריפט הבדיקה של המפתחים עם Torch 2.6.

ברירת המחדל דורשת 50 צעדי דה־נויזינג ו־CFG של 5.0 ברזולוציה של 1024 על 1024 פיקסלים. אם אתם צריכים רק תמונות בודדות ולא רוצים להחזיק מאיץ גרפי ייעודי שפועל וגוזל משאבים, עדיף להשתמש בהדגמה החינמית ב־Hugging Face Spaces במקום להרים שרת.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("ATH-MaaS/Ovis-Image-7B")
img = pipe("a photo").images[0]

הקבצים

44 קבצים במאגר, 52.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0 מלא. אתם רשאים להשתמש בו באופן חופשי למטרות מסחריות, לשנות את הקוד ולהפיץ אותו כחלק ממוצר, כל עוד אתם שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗