GPT
K

Kolors-diffusers

קוד פתוח

Kwai-Kolorsapache-2.02024-07-09

  • diffusers
  • safetensors
  • Kolors
  • zh
  • en

מודל תמונה מטקסט מבוסס דיפוזיה שמיועד לרינדור מדויק של טקסט בתוך תמונות. הוא נבנה עם דגש מיוחד על תמיכה באנגלית ובסינית, כולל תוכן תרבותי ייעודי.

  • 16.6 GBמשקל הקבצים
  • 7,711הורדות בחודש
  • 114לייקים

מה זה

המודל אומן על מיליארדי זוגות של תמונה וטקסט ומבוסס על ארכיטקטורת latent diffusion. המטרה העיקרית שלו היא יצירת תמונות פוטו-ריאליסטיות, כשהיתרון הבולט הוא היכולת לדייק בפרטים סמנטיים מורכבים ולשלב אותיות ומילים מתוך הפרומפט ישירות בתוך הפלט הגרפי.

השילוב של מודל השפה ChatGLM3 כחלק מהמערכת מאפשר לו להבין לעומק הנחיות בשפות סינית ואנגלית. בניגוד לרוב מודלי הדיפוזיה שמתקשים בכתיבת טקסט ברור או נשענים כמעט לגמרי על תרבות מערבית, כאן יש הבנה מובנית של מושגים ספציפיים ושלטי טקסט בשתי השפות האלו.

הוא מגיע בהתאמה מלאה לספריית diffusers, כך שמי שכבר מריץ פייפליינים קיימים של תמונות יכול לשלב אותו בקוד בלי לשנות ארכיטקטורה, כולל תמיכה במעבר מתמונה לתמונה.

מתאים ל

  • יצירת שלטים ופוסטרים

    המודל מרנדר אותיות באנגלית ובסינית בצורה מדויקת בתוך שלטים וכרזות.

  • עיבוד והתמרת תמונות

    הפייפליין KolorsImg2Img מאפשר לקחת תמונה קיימת ולשנות אותה לפי פרומפט.

  • שיווק המכוון לשוק הסיני

    אימון המודל כולל הבנה עמוקה של תוכן ותרבות מקומיים לצד השפה הסינית.

איפה זה נופל

למרות שהוא מצטיין בסינית ובאנגלית, אין בו שום תמיכה מובנית בעברית, כך שפרומפטים בעברית או ניסיון לכתוב אותיות עבריות בתמונה לא יעבדו. המפתחים מצהירים במפורש שהפלט סובל מאקראיות הסתברותית, והמודל רגיש להטעיות ולא מבטיח בטיחות או דיוק של המידע שנוצר בתמונה. מעבר לכך, מדובר במודל כבד שלא מתאים לשרתי קצה חלשים או להרצה בזמן אמת ללא האצה גרפית ייעודית.

שאלות
נפוצות

האם המודל יבין פרומפט שכתוב בעברית?

לא. המודל אומן ותומך רשמית רק באנגלית ובסינית. כדי לעבוד איתו צריך לתרגם את הפרומפטים לאחת משתי השפות האלו, ואין לצפות ממנו לרנדר כיתוב בעברית על גבי התמונה.

אפשר להטמיע אותו ישירות באפליקציה מסחרית?

רק אחרי אישור. הקוד אמנם תחת Apache 2.0, אבל החוקרים מחייבים חברות למלא שאלון ייעודי ולשלוח אותו במייל כדי לקבל אישור מסחרי למודל עצמו.

כמה זיכרון וידאו דרוש להרצה שלו?

הקבצים שוקלים 16.6 גיגה-בייט בדיוק כפול מופחת. תצטרכו כרטיס מסך מודרני עם לפחות 16 גיגה-בייט VRAM, ועדיף 24 גיגה-בייט כדי להימנע מנפילות זיכרון בזמן יצירת התמונה.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־16.6 גיגה-בייט בגרסת fp16, מה שאומר שתצטרכו כרטיס מסך עם לפחות 16 עד 24 גיגה-בייט של זיכרון וידאו כדי לטעון אותו ולהריץ הסקה בצורה סבירה. ההרצה מתבצעת בעזרת הספרייה diffusers, כשמומלץ להשתמש בגרסה 0.30.0.dev0 ומעלה.

ברירת המחדל עובדת עם סקדיולר מסוג EulerDiscrete ודורשת 50 צעדים עם guidance scale של 5.0. אם אתם קצרים במשאבי חישוב או רוצים לקצר זמני תגובה, אפשר לעבור לסקדיולר EDMDPMSolverMultistep, שמאפשר לרדת ל־25 צעדים באותו ערך guidance בלי לאבד את כיוון הפרומפט.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Kwai-Kolors/Kolors-diffusers")
img = pipe("a photo").images[0]

הרישיון

הקוד עצמו פתוח תחת רישיון Apache 2.0, אבל משקלי המודל אינם חופשיים לגמרי. השימוש פתוח ללא עלות רק למחקר אקדמי. מי שרוצה להשתמש במודל למוצר מסחרי נדרש למלא טופס בקשה רשמי, לשלוח אותו למייל של הצוות ולהמתין לרישום ואישור מסחרי מצידם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗