GPT
K

Kolors

קוד פתוח

Kwai-Kolorsapache-2.02024-06-05

  • diffusers
  • safetensors
  • text-to-image
  • stable-diffusion
  • kolors

מודל תמונה מטקסט עם דגש נדיר על רינדור טקסט והבנה דו לשונית של סינית ואנגלית. הבחירה בו מתאימה בעיקר לפרויקטים שצריכים שליטה מעולה בתווים ופוטוריאליזם.

  • 2.6Bפרמטרים
  • 27.0 GBמשקל הקבצים
  • 786הורדות בחודש
  • 862לייקים

מה זה

מדובר במודל דיפוזיה של 2.6 מיליארד פרמטרים מחברת Kuaishou, שאומן על מיליארדי זוגות של תמונה וטקסט. המאפיין הבולט שלו הוא היכולת לייצר אותיות ושלטים בתוך תמונות ברמת דיוק גבוהה, תחום שבו מודלים רבים עדיין מתקשים ומייצרים מריחות, לצד תמיכה מלאה בהנחיות באנגלית ובסינית.

בגודל כזה של קבצים, המודל משתלב בעבודה ישירות עם diffusers או דרך המאגר הרשמי. הוא נשען בין היתר על ChatGLM3 לעיבוד השפה, מה שנותן לו הבנה טובה יותר של הנחיות מורכבות ביחס למודלים ישנים שמסתמכים על מקודדי טקסט פשוטים.

מתאים ל

  • רינדור שלטים ותוויות

    יצירת תמונות שכוללות כיתוב ברור ומדויק באנגלית או בסינית, ללא מריחות אופייניות למודלי דיפוזיה.

  • תוכן ממוקד תרבות סינית

    הפקת דימויים שדורשים הבנה של הקשרים מקומיים בסין, בזכות שילוב מקודד השפה ChatGLM3 באימון.

  • מחקר בתחום יצירת תמונה

    בדיקת ארכיטקטורות אימון חדשות על בסיס מודל פתוח למחקר בהיקף של 2.6 מיליארד פרמטרים.

איפה זה נופל

המודל פותח סביב אנגלית וסינית בלבד, כך שאין לו שום הבנה של עברית וניסיון להנחות אותו בעברית לא יעבוד. בנוסף, המפתחים מזהירים במפורש מחוסר יכולת להבטיח את הבטיחות והדיוק של התוכן עקב האופי ההסתברותי של המודל, ומציינים שהוא רגיש להטעיות בהנחיות, מה שמחייב שכבת סינון עצמאית לפני הצגה למשתמשי קצה.

שאלות
נפוצות

האם אפשר להשתמש במודל בעברית?

לא. המודל אומן על סינית ואנגלית בלבד ולא מזהה עברית. כדי לעבוד איתו צריך לתרגם את ההנחיות לאנגלית או לסינית לפני שליחתן למודל.

האם אני יכול להטמיע את המודל ישירות באפליקציה שלי?

אם מדובר במוצר מסחרי, לא באופן מיידי. עליכם לפנות לצוות במייל, למלא טופס בקשה ולקבל רישום מסחרי לפני שתוכלו לחשוף אותו למשתמשים.

איך מריצים

הורדת המשקלים דורשת 27 גיגה בייט של אחסון, כך שמבחינת חומרה מומלץ להצטייד במעבד גרפי עם לפחות 16 עד 24 גיגה זיכרון כדי לטעון אותו ולבצע היסק בלי נפילות זיכרון. ההתקנה נשענת על פייתון 3.8, PyTorch וסביבת CUDA 11.7 ומעלה.

אם אין לכם שרת ייעודי עם כרטיס חזק, הרצה מקומית על מחשב פיתוח רגיל תהיה איטית מאוד עד בלתי אפשרית. במקרה כזה, עדיף להקים שרת זמני בענן רק לזמני העבודה או להשתמש בפתרון שמנגיש אותו ישירות.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Kwai-Kolors/Kolors")
img = pipe("a photo").images[0]

הקבצים

42 קבצים במאגר, 27.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

למרות שהמטאדאטה מציין אפאצ'י 2.0 לקוד, המפתחים קובעים בעמוד עצמו שהמודל פתוח לגמרי רק למחקר אקדמי. שימוש מסחרי מחייב מילוי שאלון ייעודי ושליחת בקשת רישום ואישור למייל של הצוות, ולכן אסור לשלב אותו במוצר מסחרי בלי אישור פרטני.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗