GPT
G

GLM-Image

קוד פתוח

zai-orgmit2026-01-08

  • diffusers
  • safetensors
  • text-to-image
  • zh
  • en

מודל פתוח שמשלב מודל שפה ודיפוזיה כדי לייצר תמונות עם טקסט מדויק. הפתרון מתאים למי שחייב כיתוב נקי באנגלית או סינית בתוך התמונה.

  • 6.9Bפרמטרים
  • 33.3 GBמשקל הקבצים
  • 11,137הורדות בחודש
  • 1,105לייקים

מה זה

הארכיטקטורה כאן חריגה בנוף. במקום להסתמך רק על דיפוזיה, החיבור כולל מודל שפה אוטורגרסיבי מבוסס GLM שמייצר טוקנים ויזואליים, ואז מפענח דיפוזיה מבוסס DiT בגודל שבעה מיליארד פרמטרים שממיר אותם לפיקסלים. השילוב הזה נותן לו הבנה סמנטית עמוקה בהרבה מהמקובל לגבי סצנות עמוסות בפרטים, לצד תמיכה בעריכת תמונה, שימור זהות והעברת סגנון באותו המודל.

היתרון הבולט ביותר מגיע ברינדור אותיות. במבחן CVTG-2K הוא הגיע לדיוק מילים של 0.9116, ציון שעוקף מודלים סגורים ופתוחים מתחרים. אם אתם צריכים תמונות שמכילות שלטים, פוסטרים או כרזות עם טיפוגרפיה ברורה, השילוב של מודול הבלוקים הייעודי לטקסט עושה את ההבדל.

מתאים ל

  • פוסטרים וגרפיקה פרסומית

    מייצר שלטים וכרזות באנגלית עם טקסט קריא שלא מתעוות, בזכות מודול ייעודי לאותיות.

  • עריכת תמונות מונחית טקסט

    מאפשר החלפת רקעים ושינוי אלמנטים בתמונה תוך שמירה על זהות הדמויות והאובייקטים.

  • סצנות ידע מורכבות

    מבין פרומפטים צפופי פרטים והקשרים בזכות מודול שפה מובנה של תשעה מיליארד פרמטרים.

איפה זה נופל

המודל תומך רק באנגלית ובסינית, כך שאין מה לבנות עליו לרינדור שלטי חוצות או כרזות בעברית. בנוסף, עלויות החישוב וזמני הריצה גבוהים מאוד ביחס למודלי דיפוזיה סטנדרטיים. כדי לקבל תוצאות מדויקות חייבים להקפיד על גרשיים סביב כל טקסט שרוצים לראות בתמונה, והרזולוציה המבוקשת חייבת להתחלק ב־32 בדיוק, אחרת תיתקלו בשגיאת ריצה מיידית.

שאלות
נפוצות

האם המודל מסוגל לייצר טקסט בעברית בתוך התמונה?

לא. התמיכה המובנית ברינדור טקסט ובהבנת פרומפטים מוגדרת לאנגלית ולסינית בלבד. ניסיון לבקש אותיות בעברית יוביל לתוצאות משובשות ולא מדויקות.

כמה זיכרון כרטיס מסך נחוץ כדי להריץ אותו בסביבת פיתוח?

לפי נתוני הפרויקט, הפעלת מנגנון פריקת זיכרון למעבד מאפשרת להריץ את הצינור בכ־23GB של זיכרון גרפי. זה מתאים לכרטיסי 24GB מקצועיים או ביתיים חזקים, אם כי זמן היצירה יתארך משמעותית.

איך מריצים

כדי להריץ אותו מקומית דרך diffusers או SGLang צריך חומרה כבדה. משקל הקבצים עומד על מעל שלושים ושלושה גיגהבייט. הרצה מלאה על כרטיס בודד דורשת משאבים רבים, אך שימוש בהעברת שכבות למעבד מוריד את דרישת הזיכרון הגרפי לסביבות 23GB VRAM במחיר של זמן יצירה איטי בהרבה.

אם אין לכם כרטיס שרת מתאים או שאתם בונים שירות שחייב תגובה מהירה למשתמשי קצה, עדיף להשתמש ב־API הייעודי שהחברה מציעה, לפחות עד שיוטמעו אופטימיזציות ריצה נוספות שהובטחו.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("zai-org/GLM-Image")
img = pipe("a photo").images[0]

הרישיון

רישיון MIT מלא. אפשר להשתמש בו לצרכים מסחריים, לשלב אותו בקוד סגור, לשנות את המשקלים או להריץ אותו בענן פרטי ללא תשלום תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗