GPT
H

HDM-xut-340M-anime

קוד פתוח

KBlueLeafcc2025-08-13

  • diffusers
  • safetensors
  • text-generation-inference
  • anime
  • text-to-image

בסיס זעיר ליצירת תמונות אנימה שתוכנן לאימון ביתי זול במיוחד. הוא מציע ארכיטקטורת שנאי מינימלית למי שרוצה לחקור מודלים מקומיים בלי תקציבי ענק.

  • 343Mפרמטרים
  • 20.0 GBמשקל הקבצים
  • 859הורדות בחודש
  • 139לייקים

מה זה

הפרויקט הזה נולד כדי לבדוק איך מאמנים מודל טקסט לתמונה מאפס בסביבה ביתית או על שרתים פשוטים ומשומשים. המפתח בנה שלד שנאי חדש בשם Cross-U-Transformer, או בקיצור XUT, ושילב טכניקה בשם TREAD כדי לצמצם את הארכיטקטורה למינימום ההכרחי. כל האימון שלו עלה לכל היותר 650 דולר במונחי שרתי vast.ai, שזה שבריר ממה שדורשים מודלים מקבילים.

הוא אומן על מאגרי תמונות אנימה מוכרים כמו Pixiv ודנבורו, ולכן היכולת שלו ממוקדת כולה בסגנון הזה בלבד. זה לא מתחרה באיכות של ענקים מסחריים, אבל כמנוע בסיס קטן שמייצר תוצאות שמישות במשאבים אפסיים, הוא מציג גישה הנדסית שונה לחלוטין ממה שמקובל בשוק.

מתאים ל

  • מחקר והתנסות בארכיטקטורה

    מאפשר לבחון את יעילות שלד XUT וטכניקת TREAD במשאבי מחשוב נמוכים.

  • יצירת איורי אנימה ב־ComfyUI

    מתחבר ישירות לסביבת העבודה הפופולרית ומייצר תמונות אנימה מקומית.

  • אימון והתאמה אישית בבית

    בסיס קל משקל שמאפשר לנסות fine-tuning על חומרה ביתית זולה.

איפה זה נופל

האימון נעשה כולו על דאטה של אנימה, כך שהוא לא יודע לייצר סגנונות אחרים, ריאליזם או צילום. בנוסף, הוא מבין הנחיות טקסט באנגלית בלבד, ואין לו הבנה של עברית. עם תקציב אימון של מאות דולרים בודדים ומשקל רשת כזה, הדיוק בפרטים מורכבים וההיענות לפרומפטים מסובכים מוגבלים מאוד לעומת מודלים גדולים.

שאלות
נפוצות

האם אפשר לייצר בעזרתו תמונות בסגנון ריאליסטי?

לא. המודל אומן ספציפית על מאגרי נתונים של אנימה והארכיטקטורה שלו מותאמת לכך. כל ניסיון לבקש סגנון צילומי יניב תוצאות לא שמישות.

איזה כרטיס מסך צריך כדי להריץ אותו?

מכיוון שהרשת כוללת פחות מ־350 מיליון פרמטרים, כמעט כל כרטיס מסך מודרני בעל זיכרון סביר יריץ אותו בקלות. הדרישה העיקרית היא נפח אחסון פנוי לקובצי המודל עצמם.

האם המודל מבין הנחיות בעברית?

לא, המודל אומן להבין הנחיות טקסט באנגלית בלבד. אם תזינו מילים בעברית, תקבלו פלט שגוי או רעש אקראי.

איך מריצים

המודל נתמך בספריית diffusers וכולל הרחבה ייעודית לממשק ComfyUI. בשביל להריץ גודל כזה של רשת לא צריך שרת ייעודי או כרטיס מקצועי יקר, וכרטיס מסך ביתי רגיל יספיק בלי בעיה. עם זאת, המשקל הכולל של הקבצים בהורדה מגיע ל־20 ג'יגה־בייט שמחולקים לעשרות חלקים, כך שצריך מקום פנוי וסבלנות בהורדה הראשונית.

אם אתם מחפשים תשתית זמינה שרצה בלחיצת כפתור בלי לגעת בהגדרות מקומיות, API מסחרי יהיה פשוט בהרבה. המודל הזה מתאים בעיקר למי שרוצה להריץ הכל מקומית על החומרה שלו, לבצע התאמות אישיות או ללמוד את מבנה הרשת.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("KBlueLeaf/HDM-xut-340M-anime")
img = pipe("a photo").images[0]

הקבצים

95 קבצים במאגר, 20.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון המדווח הוא cc כללי, בלי לציין את הגרסה המדויקת של Creative Commons. במצב כזה לא ברור אם מותר להשתמש בו לצרכים מסחריים, האם יש חובת ייחוס, או האם חל שיתוף זהה. לפני שמשלבים אותו במוצר שמפיץ תוכנה, צריך לבדוק את קובצי הרישיון המלאים במאגר הקוד.

הרישיון המלא בעמוד המודל ↗