GPT
T

TempestV0.1

קוד פתוח

dataautogpt3gpl-3.02024-03-08

  • diffusers
  • text-to-image
  • endpoints_compatible

מודל מחולל תמונות שאומן על תמונות ברזולוציה גבוהה כדי לייצר פירוט ישיר בלי תוכנת הגדלה נפרדת. הוא מכוון למי שרוצה פלט מפורט של טקסטורות ישירות מהריצה הראשונה.

  • 25.9 GBמשקל הקבצים
  • 122הורדות בחודש
  • 112לייקים

מה זה

מדובר במודל שנועד לייצר תמונות ישירות ברזולוציות כמו 2048x1024 או 1920x1088, בלי לעבור דרך שלב של upscale. היוצר שלו אימן אותו על מאגר של מעל שישה מיליון תמונות ברזולוציות שהגיעו עד 4800x7200, לאורך שלושה מיליון איטרציות, במטרה לשמור על חדות של טקסטורות ופרטים קטנים ישירות ביציאה מהמודל.

הפרויקט מחולק לשתי גרסאות. גרסת Base היא המודל הנקי כפי שאומן, בעוד גרסת Artistic היא שילוב של המודל הזה עם Proteus, שנותן תוצאה סגנונית יותר אבל שומר פחות על לכידות גיאומטרית ברזולוציות הגבוהות.

מתאים ל

  • יצירת תמונות רחבות

    פלט ישיר ביחס 2048x1024 או 1920x1088 שחוסך צורך בכלי חידוד נוספים.

  • סגנון אמנותי עשיר

    שימוש בגרסת Artistic כשמחפשים שפה חזותית בולטת ולא דיוק מבני.

  • בדיקת טקסטורות עדינות

    אימון המקור על רזולוציות ענק נותן פירוט משטחים שקשה להוציא ממודלים רגילים.

איפה זה נופל

הבעיה המרכזית היא חוסר תאימות לרכיבי LoRA ברזולוציות גבוהות, בגלל הבדלי ההתפלגות של המידע שעליו הוא אומן. אם תהליך העבודה שלכם נשען על התאמות סגנון אישיות, הוא לא יעבוד כאן כמצופה. בנוסף, זמני היצירה ארוכים מאוד בגלל הצורך ב־60 עד 80 צעדים, וגרסת Artistic מאבדת לכידות ומייצרת עיוותים ברזולוציות המלאות.

שאלות
נפוצות

אפשר להשתמש ב־LoRA כדי להתאים סגנון?

לא ברזולוציות הגבוהות. היוצר מציין במפורש שההבדלים בהתפלגות הנתונים שוברים שימוש בתוספי LoRA בגדלים האלה.

איזו גרסה מתאימה למה?

גרסת Base מתאימה למי שצריך תמונה אחידה ומדויקת מבחינה מבנית. גרסת Artistic, שמשלבת את Proteus, מוסיפה אופי וסגנון אבל נוטה להתפרק יותר בגדלים המקסימליים.

כמה צעדים צריך להגדיר ביצירה?

ההנחיה הרשמית היא בין 60 ל־80 צעדים, עם CFG שנע בין 7 ל־8 בגרסת הבסיס, או 3 עד 8 בגרסה האמנותית. זה אומר זמני הפקה ארוכים יותר מרוב המודלים המקבילים.

איך מריצים

כדי לעבוד איתו צריך להוריד כמעט 26 ג'יגה בייט של קבצים ולהשתמש בספריית diffusers. מודל בגודל כזה, שמייצר תמונות ברזולוציה של שני מגה פיקסל ומעלה, דורש כרטיס מסך חזק עם זיכרון וידאו משמעותי, במיוחד כשההמלצה הרשמית דורשת בין 60 ל־80 צעדים לכל תמונה.

אם אין לכם חומרה ייעודית מקומית עם מספיק VRAM, הריצה תיקח דקות ארוכות לכל פריים. במצב כזה עדיף להרים מופע ענן עם כרטיס תואם במקום לנסות לדחוף את זה למחשב פיתוח רגיל.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("dataautogpt3/TempestV0.1")
img = pipe("a photo").images[0]

הרישיון

הרישיון המדווח הוא GPL 3.0, וזה רישיון מדבק. מותר להשתמש בו ולשנות אותו, אבל אם אתם מפיצים מוצר או שירות שמכיל אותו, תצטרכו לשחרר את כל קוד המקור שלכם תחת אותו רישיון בדיוק. למוצרים מסחריים סגורים הוא פשוט לא מתאים.

הרישיון המלא בעמוד המודל ↗