GPT
N

NewBie-image-Exp0.1

קוד פתוח

NewBie-AIother2025-11-30

  • diffusers
  • safetensors
  • next-dit
  • text-to-image
  • transformer

מודל תמונה שמייצר איורי אנימה ומפריד תכונות בין דמויות באמצעות פרומפטים בפורמט XML. הוא משלב את הארכיטקטורה של Next-DiT עם מקודד הטקסט Gemma3-4B-it.

  • 3.5Bפרמטרים
  • 24.6 GBמשקל הקבצים
  • 334הורדות בחודש
  • 299לייקים

מה זה

הארכיטקטורה כאן מחברת כמה רכיבים מוכרים יחד. בבסיס נמצא מודל Next-DiT עם 3.5 מיליארד פרמטרים שמתמקד ביצירת תמונות אנימה, כשהוא מחובר אל Gemma3-4B-it כמקודד טקסט עיקרי לצד שילוב תכונות מ־Jina CLIP v2, ואת התמונה עצמה הוא מוציא דרך ה־VAE בן 16 הערוצים של FLUX.1-dev.

החידוש המעשי נמצא בדרך שבה המודל מבין הוראות. האימון נעשה על טקסטים במבנה XML, מה שעוזר לו למנוע זליגת תכונות בסצנות מרובות דמויות, למשל לוודא שצבע שיער או פריט לבוש יישארו שייכים לדמות הנכונה ולא יתערבבו על שאר הדמויות. אפשר לכתוב לו גם בשפה חופשית או בתגיות רגילות, אבל הדיוק יורד שם.

מתאים ל

  • איור סצנות אנימה מורכבות

    פרומפט ב־XML מאפשר להגדיר מספר דמויות בלי שצבעי הבגדים והשיער יתערבבו.

  • אימון LoRA לדמויות

    היוצרים מציעים כלי ייעודי לאימון מתאמים חדשים מעל בסיס ה־Next-DiT.

  • בדיקת ממשקי הנחיה מובנים

    מערכת שבוחנת הזנת פרומפטים מבוססי תגיות קוד במקום שפה טבעית חופשית.

איפה זה נופל

המודל אומן מראש על מאגר נתוני אנימה בלבד. הוא לא מסוגל לייצר תמונות פוטו-ריאליסטיות, סגנונות עיצוב אחרים או טקסטים בעברית, מאחר שמקודדי הטקסט והאימון הוגדרו לאנגלית. בנוסף מדובר בגרסה ניסיונית ראשונה, Exp0.1, והמפתחים מציינים שהפלט עשוי לכלול תוצאות בלתי צפויות ומזיקות. יתרון ההפרדה בין דמויות תלוי כמעט לחלוטין בניסוח פרומפטים ב־XML, מה שמקשה על שילוב שלו במערכות קיימות שעובדות עם טקסט רגיל.

שאלות
נפוצות

אפשר להשתמש במודל הזה באפליקציה בתשלום?

לא. משקולות המודל והפיתוחים שנגזרים מהן מוגבלים לשימוש לא מסחרי בלבד. כל מוצר שמייצר הכנסות ידרוש בדיקה של רישוי חלופי מול היוצרים.

חייבים לכתוב פרומפטים ב־XML?

לא חובה, הוא מקבל גם שפה חופשית ותגיות רגילות. עם זאת, כל היתרון שלו בהפרדת תכונות בין דמויות נשען על המבנה הזה, ובלעדיו הדיוק נפגע.

איך מריצים

קובצי המשקולות שוקלים 24.6 גיגה בייט, ובשילוב מקודד טקסט של 4 מיליארד פרמטרים צריך כאן כרטיס מסך עם לפחות 24 גיגה בייט זיכרון כדי להריץ ב־bfloat16. הקוד נתמך ישירות דרך ספריית diffusers עם תמיכה ב־ComfyUI, והרצה טיפוסית מוגדרת ל־28 צעדים ברזולוציה של 1024 על 1024.

מי שאין לו חומרה מתאימה מקומית יתקשה לדחוס את כל הרכיבים האלה לכרטיס ביתי פשוט, במיוחד כשחלק מהרכיבים כמו ה־VAE נלקחו מפרויקטים נפרדים. אם אתם לא מחזיקים שרת ייעודי, פתרונות ענן יהיו האופציה היחידה להרצה שוטפת.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("NewBie-AI/NewBie-image-Exp0.1")
img = pipe("a photo").images[0]

הרישיון

הקוד עצמו משוחרר תחת רישיון Apache 2.0, אבל משקולות המודל והנגזרות שלהן כפופות לרישיון Newbie-NC-1.0. הרישיון הזה אוסר שימוש מסחרי מכל סוג ומחייב שיתוף של כל אימון, LoRA או מיזוג תחת אותם תנאים. לשימוש במוצר רווחי המודל הזה פסול.

הרישיון המלא בעמוד המודל ↗