GPT
N

Nucleus-Image

קוד פתוח

NucleusAIapache-2.02026-03-17

  • diffusers
  • safetensors
  • moe
  • sparse-moe
  • diffusion

מודל תמונה שמחזיק 17 מיליארד פרמטרים אבל מפעיל רק שניים בכל צעד. הוא מביא איכות של מודל ענק עם חישוב של מודל קטן.

  • 17Bפרמטרים
  • 48.1 GBמשקל הקבצים
  • 1,148הורדות בחודש
  • 261לייקים

מה זה

זהו מודל ליצירת תמונות מטקסט שמבוסס על ארכיטקטורת תערובת מומחים דלילה. הוא כולל 32 שכבות דיפיוז'ן, כשברוב השכבות יש 64 מומחים מנותבים ומומחה אחד משותף. טוקנים של טקסט בכלל לא נכנסים לעמוד השדרה של הטרנספורמר אלא משמשים רק כמפתחות וערכים, מה שחוסך ניתוב ומאפשר לשמור את המצב שלהם בזיכרון מטמון לאורך כל הצעדים.

במבחני ביצועים הוא עוקף מודלים מובילים אחרים. בבנצ'מרק GenEval הוא הגיע לציון 0.87, עם הובלה ביחסים מרחביים בין עצמים, ובמדד DPG-Bench קיבל 88.79 בזיהוי ישויות ותכונות מדויקות. כל המספרים האלה הושגו ישירות מאימון הבסיס, ללא כוונון העדפות אנושיות או אופטימיזציה נוספת.

מתאים ל

  • יצירת פורטרטים מפורטים

    מייצר דמויות ומרקמי עור עשירים בדיוק גבוה הודות לארכיטקטורת המומחים.

  • צילום מוצר ומסחר

    מתאים להדמיות מוצר וקומפוזיציות מדויקות שמבוססות על תיאורי טקסט מפורטים.

  • בסיס לאימון והתאמה אישית

    משמש נקודת מוצא מצוינת לכוונון עצמאי בזכות היותו מודל בסיס פתוח ללא התערבות DPO.

איפה זה נופל

המודל שוחרר כמודל בסיס נקי לגמרי. אין עליו שום שכבה של כוונון באמצעות משוב אנושי, יישור העדפות או DPO, מה שאומר שהוא עשוי להתנהג באופן לא צפוי עם הנחיות מורכבות או לייצר פלטים פחות מלוטשים מאשר מודלים מסחריים שעברו עידון. בנוסף, הוא תומך באנגלית בלבד ואומן על טקסט באנגלית, כך שפרומפטים בעברית ידרשו תרגום מקדים לפני השליחה.

שאלות
נפוצות

האם המודל מבין פרומפטים בעברית?

לא. המודל אומן על אנגלית בלבד ומקודד הטקסט שלו מוגדר לאנגלית. כדי לעבוד איתו צריך לתרגם את ההנחיות לפני השליחה לצינור היצירה.

כמה זיכרון וידאו נחוץ כדי להריץ אותו?

הקבצים שוקלים 48.1 גיגה בייט. למרות שבכל רגע נתון רצים רק כ־2 מיליארד פרמטרים, כל 17 המיליארד חייבים לשבת בזיכרון, ולכן נדרש כרטיס עם 64 עד 80 גיגה בייט לפחות.

איך מריצים

משקל הקבצים עומד על 48.1 גיגה בייט, כך שצריך כרטיס מסך עם זיכרון וידאו עצום, לפחות 64 או 80 גיגה בייט כדי להחזיק את כל המשקלים בזיכרון המקומי, גם אם בזמן החישוב מופעל רק חלק קטן מהם. ההרצה נעשית דרך ספריית diffusers ומצריכה גרסה עדכנית מגיטהאב, יחד עם הפעלת TextKVCacheConfig לחיסכון בזמן הריצה.

אם אין לכם שרת ייעודי חזק בענן עם כרטיסי A100 או H100, אין טעם לנסות להריץ אותו על חומרה ביתית רגילה. במצב כזה עדיף לחכות שמישהו יציע אותו דרך ממשק תוכנה מנוהל.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("NucleusAI/Nucleus-Image")
img = pipe("a photo").images[0]

הקבצים

38 קבצים במאגר, 48.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהטמיע אותו במוצרים, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗