GPT
E

ERNIE-Image-GGUF

קוד פתוח

unslothapache-2.02026-04-14

  • ggml
  • gguf
  • text-to-image
  • unsloth

גרסת קוונטיזציה בפורמט GGUF למודל יצירת תמונות בן 8 מיליארד פרמטרים. הוא מיועד למי שרוצה שליטה חזקה בטקסט ובפריסה על חומרת קצה בלי לשלם על מודלי ענק.

  • 115 GBמשקל הקבצים
  • 2,071הורדות בחודש
  • 70לייקים

מה זה

בבסיס נמצא מודל דיפוזיה מסוג DiT עם שמונה מיליארד פרמטרים שפותח על ידי באידו, ומשולב עם מנגנון הרחבת פרומפטים מובנה. Unsloth ארזו אותו מחדש בפורמט GGUF תוך שימוש בשיטה שמשאירה שכבות קריטיות בדיוק גבוה, ומיועדת לעבודה עם ComfyUI. הדגש העיקרי כאן הוא לא רק ציור כללי, אלא דיוק במבנה התמונה, רינדור טקסט ארוך ומורכב בתוך העיצוב, ומעקב אחרי הנחיות שמכילות מספר אובייקטים וקשרים ביניהם.

במבחני ביצועים כמו GENEval הוא מציג תוצאות חזקות מאוד במיקום אובייקטים והבנת צבעים, עם ציון כולל של 0.8856 שמקדים חלופות כמו FLUX.2 klein. בטבלאות LongTextBench הוא שומר על יציבות גבוהה בכתיבת טקסט באנגלית ובסינית, מעל תשעים ושבעה אחוזים. המשמעות בשטח היא פחות עיוותים באותיות ופחות אלמנטים שמשתבשים כשמבקשים ממנו פוסטר או קומיקס מרובה פרטים.

מתאים ל

  • עיצוב פוסטרים שיווקיים

    שילוב של טקסט מדויק ופריסה מוגדרת בלי עיוותים באותיות.

  • יצירת קומיקס מרובה משבצות

    שמירה על מבנה עמודים ויחסים ברורים בין כמה דמויות.

  • עיצוב ממשקי משתמש ואינפוגרפיקה

    רינדור נקי של בלוקי תוכן וטקסט צפוף לפי הנחיות מפורטות.

איפה זה נופל

למרות הדיוק בטקסט, תחום ההסקה הלוגית מוגבל מאוד. במבחן OneIG המודל מקבל ציונים של סביב 0.35 בלבד ביכולת הסקה, וציון הגיוון עומד על 0.24, מה שאומר שהוא מתקשה בהבנת רעיונות מופשטים עמוקים ונוטה לחזור על אותם סגנונות ויזואליים.

בנוסף, ספירת אובייקטים מדויקת מגיעה ל־0.77 בלבד בגרסה הרגילה ללא מרחיב הפרומפטים. אם תבקשו מספר מדויק של פריטים זהים, יש סיכוי סביר לטעויות ספירה.

שאלות
נפוצות

האם צריך להוריד את כל 115 הגיגה בייט כדי להפעיל אותו?

לא. המאגר מכיל 23 קבצים שמייצגים רמות דחיסה שונות בפורמט GGUF. אתם בוחרים קובץ יחיד בהתאם לנפח הזיכרון הפנוי בכרטיס המסך שלכם ומורידים רק אותו.

איך משלבים אותו בסביבת עבודה קיימת?

ההרצה נשענת על ComfyUI בעזרת התוסף ComfyUI-GGUF שפותח על ידי city96. הקובץ נטען ישירות כמודל דיפוזיה בתוך ה־workflow ללא צורך בהמרות נוספות.

איך מריצים

המשקל הכולל של הקבצים במאגר מגיע ל־115 גיגה בייט בגלל פיצול למספר גרסאות קוונטיזציה שונות. בפועל מורידים רק את קובץ ה־GGUF שמתאים לתקציב הזיכרון, ולא את כל המאגר. המודל המקורי תוכנן לרוץ על כרטיסי מסך ביתיים עם 24 גיגה בייט זיכרון וידאו, וההרצה כאן נשענת על כלי ComfyUI-GGUF של city96.

גרסת ה־SFT המלאה דורשת 50 צעדי דגימה עם Guidance scale של 4.0 כדי לייצר תוצאה מדויקת. אם אתם מחפשים מהירות בייצור של מיליוני תמונות, 50 צעדים הם עומס חישובי כבד, ובמצב כזה עדיף לבדוק שירותי ענן או את גרסת הטורבו שמסתפקת בשמונה צעדים.

ollama run hf.co/unsloth/ERNIE-Image-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המאגר מפורסם תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש חופשי בקוד ובמשקלים, כולל שימוש מסחרי, שינוי והפצה, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של תנאי הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗