GPT
C

Chroma1-HD

קוד פתוח

lodestonesapache-2.02025-08-08

  • diffusers
  • safetensors
  • text-to-image

גרסה פתוחה ומכווצת של פלוקס ליצירת תמונות מטקסט. מי שמחפש בסיס נקי לאימון מודל מותאם בלי להסתבך עם הגבלות שימוש ימצא כאן מענה ישיר.

  • 8.9Bפרמטרים
  • 42.2 GBמשקל הקבצים
  • 72,626הורדות בחודש
  • 403לייקים

מה זה

מדובר במודל בסיס ליצירת תמונות מטקסט שמבוסס על הארכיטקטורה של FLUX.1-schnell. המפתח חתך את שכבת קידוד הזמן המקורית מנפח מוגזם של מעל שלושה מיליארד פרמטרים לרשת קטנה בהרבה, וכך כיווץ את המודל מ־12 מיליארד ל־8.9 מיליארד פרמטרים. האימון נעשה על חמישה מיליון תמונות שנבחרו מתוך מאגר של עשרים מיליון, כולל סגנונות אמנותיים, צילום ותכנים נישתיים.

בנוסף לכיווץ השכבה, בוצעו שינויים כמו מיסוך של טוקני פדינג בטקסט כדי לייצב את התהליך ושימוש בהתפלגות דגימת זמנים מותאמת אישית כדי למנוע קפיצות שגיאה פתאומיות. המטרה כאן היא לא עוד כלי סגור לייצור תמונות במכה אחת, אלא צ'קפוינט ניטרלי ונוח שמיועד לשמש בסיס למי שרוצה לאמן עליו סגנונות חדשים.

מתאים ל

  • אימון מודלים מותאמים

    צ'קפוינט בסיס נקי שתוכנן מראש כדי שתוכלו לאמן עליו סגנונות ודמויות חדשות.

  • הטמעה במוצרים מסחריים

    רישיון אפאצ'י מלא מאפשר לשלב את המודל במערכות ייצור בלי חשש מתביעות.

  • מחקר על מודלי דיפוזיה

    בדיקת התנהגות מודלים והשפעת שינויי ארכיטקטורה על בסיס מודל פתוח.

איפה זה נופל

המודל שוחרר ללא שום שכבת סינון, יישור או בקרת בטיחות, והוא עלול לייצר תוכן פוגעני, מפורש או מוטה בהתאם למידע שנאסף מהרשת. כל האחריות לסינון הפלטים מוטלת עליכם. בנוסף, מדובר במודל בסיס שדורש הורדה של רכיבים חיצוניים כבדים כמו מקודד הטקסט כדי לתפקד בסביבות כמו ComfyUI, והדו"ח הטכני המלא שמתאר את כל השינויים טרם פורסם.

שאלות
נפוצות

האם אפשר להשתמש במודל ישירות בתוך מוצר מסחרי?

כן, הרישיון הוא רישיון אפאצ'י פתוח שאינו מגביל שימוש מסחרי. עם זאת, תצטרכו לבנות סביבו מערכת סינון עצמאית, כי המודל מגיע בלי מנגנוני הגנה מובנים.

מה צריך להוריד חוץ מקובצי המודל עצמם כדי לעבוד ב־ComfyUI?

חוץ מהמשקלים של המודל, צריך להוריד בנפרד את מקודד הטקסט T5 XXL safetensors, את ה־VAE של פלוקס, ואת קובץ ה־JSON של תהליך העבודה שמצורף למאגר.

איך מריצים

כדי להריץ אותו מקומית מורידים מעל 42 ג'יגה בייט של קבצים, מה שאומר שחייבים כרטיס מסך חזק עם שפע זיכרון וידאו ונפח אחסון מהיר, או שימוש בכימות דרך gemlite כדי לצמצם דרישות. המודל נתמך ישירות בספריית diffusers ודורש התקנה של ספריות כמו transformers ו־accelerate.

אפשר גם לעבוד איתו בתוך ComfyUI באמצעות תהליך עבודה ייעודי שמסופק בפרויקט, אבל התהליך דורש מכם להוריד בנפרד את מקודד הטקסט T5 XXL ואת ה־VAE של פלוקס. למי שרוצה רק לבדוק תוצאות בלי להקים את כל השרשרת הזו על חומרה מקומית כבדה, היוצרים מציעים להריץ אותו דרך הפלטפורמה של Fictional.ai, או לבחור בגרסת Chroma1-Flash אם מחפשים ריצה מהירה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("lodestones/Chroma1-HD")
img = pipe("a photo").images[0]

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקלים, והפצה מחדש כחלק ממוצר סגור או פתוח, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗