GPT
E

baidu/ERNIE-Image

קוד פתוח

baiduapache-2.02026-04-07

  • diffusers
  • safetensors
  • text-to-image
  • 8B

מודל פתוח של 8 מיליארד פרמטרים שמייצר תמונות מטקסט. הוא מתאים למי שחייב רינדור מדויק של טקסט מורכב וקומפוזיציות בנויות היטב בכרטיס מסך בודד.

  • 8Bפרמטרים
  • 29.5 GBמשקל הקבצים
  • 1,348הורדות בחודש
  • 671לייקים

מה זה

מדובר במודל מבוסס Diffusion Transformer עם זרם יחיד, שמגיע לצד רכיב ייעודי להרחבת פרומפטים קצרים למבנים מפורטים. הייחוד העיקרי שלו מול חלופות פתוחות באותו סדר גודל הוא השילוב בין מעקב הדוק אחרי הוראות לבין רינדור אותיות. המודל מתמקד לא רק באסתטיקה כללית, אלא ביכולת לייצר פריסות מורכבות כמו פוסטרים, קומיקסים ותבניות מרובות פאנלים בלי לאבד את הקשר בין האלמנטים.

במדדי GENEval המודל מציג ציון של 1.0000 בעצם יחיד וציון כולל של 0.8856 ללא הרחבת פרומפט, מה שמציב אותו מעל מודלים כמו FLUX.2-klein-9B בהבנת מיקום וקשרים בין עצמים. במבחני טקסט ארוך כמו LongTextBench הוא שומר על ציונים מעל 0.96 גם באנגלית וגם בסינית, מה שמסביר את היכולת שלו לשלב פסקאות קריאות בתוך עיצובים גרפיים.

מתאים ל

  • עיצוב פוסטרים ואינפוגרפיקה

    הוא מצטיין ברינדור טקסט ארוך ובשמירה על מבנה טיפוגרפי תקין.

  • עמודי קומיקס וסטוריבורד

    הארכיטקטורה שלו מותאמת לפריסות מרובות פאנלים ומיקום עצמים.

  • הדמיות ממשק ועיצוב

    הוא מפיק אלמנטים גרפיים נקיים עם שילוב טקסט ברור.

איפה זה נופל

למרות השליטה בטקסט, יש לו נקודות חולשה ברורות. במבחני ספירה הוא מקבל ציון 0.7781 בלבד ללא הרחבת פרומפטים, כך שאם הפרומפט דורש כמות מדויקת של פריטים, הוא עלול לטעות. שיוך תכונות עומד על 0.7225 עם הרחבת פרומפט. בנוסף, מדדי ההיגיון במבחני OneIG נמוכים למדי ונעים סביב 0.30 עד 0.35, והרצות ברזולוציות שחורגות מהרשימה המומלצת עלולות לפגוע ביציבות התוצאה.

שאלות
נפוצות

האם כדאי להפעיל תמיד את רכיב ה־Prompt Enhancer?

לא תמיד. במבחני GENEval המודל השיג ציון כולל גבוה יותר של 0.8856 בלעדיו לעומת 0.8728 איתו, במיוחד בדיוק צבעים ושיוך תכונות. עם זאת, הרכיב עוזר כשמשתמשים בפרומפטים קצרים מאוד או כשנדרש חידוד טקסטואלי במבחני OneIG.

מה ההבדל המעשי בין הגרסה הזו לגרסת הטורבו?

הגרסה הזו דורשת 50 צעדי חישוב ומכוונת לרמת דיוק גבוהה יותר בהוראות מורכבות. גרסת הטורבו אומנה בשיטות DMD ו־RL כדי להפיק תוצאה אסתטית ב־8 צעדים בלבד, מה שמקצר משמעותית את זמן ההמתנה אבל מציג ביצועים מעט נמוכים יותר בחלק ממדדי ההבנה.

איך מריצים

כדי להריץ אותו עצמאית נדרש מעבד גרפי עם 24GB זיכרון לפחות, עליו שוקלים קובצי המודל 29.5GB. ההרצה המקומית נתמכת דרך ספריית diffusers העדכנית מגיטהאב או באמצעות שרת SGLang. הגרסה הרגילה מבוססת SFT ודורשת 50 צעדי דגימה עם guidance scale של 4.0 כדי להפיק איכות מלאה ברזולוציות מוגדרות מראש, כגון 1024x1024 או 1200x896.

אם מהירות היא שיקול מרכזי בתשתית שלכם, שווה לבדוק את גרסת הטורבו שמסתפקת ב־8 צעדים. עבור סביבות ענן ללא חומרה מקומית ייעודית, אפשר לבדוק את הביצועים קודם בהדגמות הזמינות ב־Huggingface או AI Studio.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("baidu/ERNIE-Image")
img = pipe("a photo").images[0]

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו חופשית לפרויקטים מסחריים ופרטיים, לשנות את הקוד ולהפיץ אותו, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗