GPT
E

ERNIE-Image-Turbo

קוד פתוח

baiduapache-2.02026-04-02

  • diffusers
  • safetensors
  • text-to-image
  • 8B

גרסה מזוקקת ליצירת תמונות מטקסט שמייצרת פלט איכותי ב־8 צעדי הסקה בלבד. מתאים במיוחד למי שרוצה לרנדר טיפוגרפיה צפופה ופוסטרים בלי לחכות עשרות שניות.

  • 8Bפרמטרים
  • 29.5 GBמשקל הקבצים
  • 3,684הורדות בחודש
  • 403לייקים

מה זה

מדובר במודל Diffusion Transformer מסוג single stream בגודל 8 מיליארד פרמטרים, שעבר זיקוק באמצעות שיטות DMD ולמידת חיזוק. בעוד גרסת הבסיס דורשת 50 צעדים, גרסת הטורבו מתוכננת לחתוך את זמני הריצה תוך שמירה על דיוק גבוה בפרטים, הבנת הוראות מורכבות ורינדור מדויק של פריסות מובנות כמו קומיקסים ולוחות סיפור.

היתרון המרכזי כאן הוא שילוב של טקסט בתוך תמונה. במבחני LongTextBench המודל מציג ציון 0.9675 באנגלית ו־0.9636 בסינית, מה שמעיד על דיוק גבוה באיות ועימוד גרפי מורכב לעומת מתחרים בקטגוריה. הוא אמנם מקריב מעט מגוון ודיוק בהבנת יחסים מורכבים ביחס לגרסה המלאה, אך שומר על ציון כולל תחרותי מאוד של 0.8667 במדד GENEval.

מתאים ל

  • פוסטרים ושלטי פרסום

    מרנדר טקסט מדויק בפריסות גרפיות צפופות עם מעט מאוד עיוותי איות.

  • לוחות סטוריבורד וקומיקס

    מייצר פריסות מרובות פאנלים ומבנים קומפוזיציוניים מסודרים במהירות גבוהה.

  • מערכות יצירה בזמן אמת

    מספק תמונות ב־8 צעדי הסקה בלבד, מה שמקצר משמעותית את זמן ההמתנה של המשתמש.

איפה זה נופל

הקיצור ל־8 צעדים גובה מחיר ברור, והמדדים מראים ירידה משמעותית בגיוון התוצאות, עם ציון של 0.1232 בלבד ב־Diversity במבחן OneIG-EN לעומת 0.2411 בגרסת הבסיס. היכולת להסיק מסקנות ויזואליות נשארת נמוכה יחסית, עם ציוני Reasoning סביב 0.29 עד 0.35, ובמבחן GENEval ציון הספירה יורד לאזור 0.79. בנוסף, המבחנים מתמקדים באנגלית ובסינית בלבד, כך שאין תיעוד ליכולת רינדור טקסט בעברית ויש לבדוק זאת ידנית.

שאלות
נפוצות

האם המודל יצליח לרנדר טקסט בעברית בתוך התמונה?

כרטיס המודל והמבחנים הרשמיים מתייחסים אך ורק לאנגלית ולסינית. מודלים מסוג זה נכשלים לרוב בטיפוגרפיה עברית, ולכן צריך לבדוק אותו עצמאית לפני שמסתמכים על רינדור מקומי.

מה ההבדל בין גרסת הטורבו לגרסת ה־SFT הרגילה?

גרסת הבסיס דורשת כ־50 צעדים ומספקת דיוק גבוה יותר במיקומים ובגיוון הכללי. גרסת הטורבו רצה ב־8 צעדים בלבד ומיועדת למקרים שבהם מהירות התגובה קריטית, במחיר של פחות גיוון בין תוצאות.

איך מריצים

כדי להריץ אותו עצמאית נדרש כרטיס מסך עם לפחות 24GB זיכרון וידאו, מה שמאפשר שימוש בכרטיסים שולחניים חזקים יחסית. הריצה נתמכת בספריית diffusers העדכנית וכן ב־SGLang למי שרוצה להרים שרת הסקה ייעודי. הפרמטרים המומלצים הם Guidance scale קבוע של 1.0 ו־8 צעדים בלבד, ברזולוציות מוגדרות סביב מגה פיקסל אחד.

אם אין לכם כרטיס עם 24GB VRAM או שאתם לא רוצים להתעסק עם הורדה של כ־29.5GB של משקלים, אין טעם להילחם בחומרה מקומית. במקרה כזה עדיף לצרוך את המודל דרך ספקי ענן או ממשקי הדגמה ייעודיים ברשת במקום להחזיק תשתית פעילה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("baidu/ERNIE-Image-Turbo")
img = pipe("a photo").images[0]

הרישיון

המודל משוחרר תחת רישיון Apache 2.0 המוכר. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים ולהפיץ אותם בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗