GPT
C

CogView4-6B

קוד פתוח

zai-orgapache-2.02025-03-03

  • diffusers
  • safetensors
  • text-to-image
  • zh
  • en

מודל פתוח ליצירת תמונות מטקסט שמבוסס על מודל השפה GLM-4-9B. הוא מיועד למי שמחפש שליטה מדויקת ביחסים מורכבים בין עצמים ושילוב טקסט בסינית ובאנגלית.

  • 6.4Bפרמטרים
  • 29.0 GBמשקל הקבצים
  • 5,687הורדות בחודש
  • 257לייקים

מה זה

המודל פועל עם 6.4 מיליארד פרמטרים ומסתמך על GLM-4 כבסיס הטקסטואלי שלו, מה שמעניק לו הבנה לשונית עמוקה יותר מרוב המודלים שמשתמשים במפענחי טקסט רגילים. הוא מייצר תמונות ברזולוציות שנעות בין 512 ל־2048 פיקסלים, כל עוד הממדים מתחלקים ב־32 ולא חוצים את תקרת שני מיליון הפיקסלים הכוללת.

במדדי ביצועים כמו DPG-Bench הוא עוקף מודלים מובילים בקטגוריות של תכונות ויחסים בין עצמים, עם ציון כולל של 85.13. בנוסף, הוא מוביל במבחני דיוק טקסט בסינית בהשוואה למודלים ייעודיים כמו Kolors, ומציג תוצאות גבוהות במיוחד במשימות שמערבות ספירה של אובייקטים והרכבים מורכבים.

מתאים ל

  • שילוב כתב סיני בתמונות

    המודל עוקף מודלים מתחרים בדיוק שחזור תווים וטקסט בסינית.

  • הפקת סצנות מרובות עצמים

    הוא מציג ציונים מובילים בהבנת קשרים ותכונות בין פריטים שונים.

  • יצירת תמונות ביחסי צד שונים

    תמיכה גמישה במידות שבין 512 ל־2048 פיקסלים בהתאמה לצורכי הפרויקט.

איפה זה נופל

המודל תומך רשמית באנגלית ובסינית בלבד, כך שאין מה לבנות על הבנת הנחיות בעברית ללא תרגום מוקדם. במבחן GenEval הוא מקבל ציון נמוך של 0.48 במיקום מרחבי של עצמים, מה שאומר שהוא מתקשה להציב אלמנטים בדיוק בנקודה המבוקשת. בנוסף, חוסר היכולת להריץ אותו ב־FP16 סוגר את הדלת בפני חומרות ישנות שלא תומכות ב־BF16 בצורה יעילה.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך ביתי של 16GB?

זה אפשרי רק אם מפעילים העברת משקלים למעבד ומורידים את מקודד הטקסט ל־4 ביט, תצורה שלוקחת בין 13GB ל־14GB זיכרון וידאו. ללא האופטימיזציות האלה המודל דורש מעל 33GB זיכרון ויקרוס מיד.

למה התמונות שנוצרות יוצאות שחורות לחלוטין?

הבעיה נובעת מהרצה בדיוק FP16 שגורמת לגלישה מספרית בחישובים. חובה להגדיר את המודל לעבודה בדיוק BF16 או FP32 כדי לקבל פלט תקין.

איך מריצים

בשביל להריץ אותו עצמאית תצטרכו כרטיס מסך חזק מאוד. ללא פריקה של משקלים לזיכרון המעבד, בדיקות עם גודל אצווה 4 דורשות בין 33GB ל־39GB של זיכרון וידאו, תלוי ברזולוציית התמונה. שימוש במודל מחייב התקנה של ספריית diffusers ישירות ממאגר הגיטהאב.

אפשר לחסוך זיכרון ולרדת עד לאזור ה־13GB או 14GB אם מפעילים פריקה למעבד ומכווצים את מקודד הטקסט לרמת 4 ביט. שימו לב שהמודל עובד רק בדיוק של BF16 או FP32, מכיוון שהרצה ב־FP16 גורמת לגלישת מספרים ומייצרת תמונות שחורות לחלוטין.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("zai-org/CogView4-6B")
img = pipe("a photo").images[0]

הרישיון

המודל משוחרר תחת רישיון Apache 2.0 המלא. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗