GPT
P

ProteusV0.3

קוד פתוח

dataautogpt3gpl-3.02024-02-12

  • diffusers
  • text-to-image
  • endpoints_compatible

גרסה שמכוונת ספציפית לשילוב בין אנימה, סוריאליזם וריאליזם, על בסיס שיפורים ישירים לתוך OpenDalleV1.1. היא מתאימה למי שרוצה תאורה חדה יותר ותגובה מדויקת לפרומפטים מורכבים.

  • 19.4 GBמשקל הקבצים
  • 16,229הורדות בחודש
  • 96לייקים

מה זה

הבסיס כאן נבנה כהרחבה ישירה על OpenDalleV1.1, תוך שימוש בכוונון עדין על 220,000 תמונות עם כיתובי GPTV ואימון DPO על 10,000 זוגות תמונות שנבחרו מראש. המפתחים שילבו לתוכו מספר מודלי LoRA שאומנו בנפרד והוטמעו רק בחלקים מסוימים של המודל. המטרה של המהלך הזה הייתה לשפר תווי פנים ומרקמי עור בלי לחרב סגנונות אחרים.

עדכון גרסה 0.3 הוסיף עוד 200,000 תמונות אנימה ו־15,000 תמונות נבחרות לשיפור התאורה. לפי התיעוד, המודל שומר על היכולות הפוטו־ריאליסטיות שלו לצד היכולת לייצר סגנון אנימה, קריקטורה וסוריאליזם, בלי שאימון היתר ימחק את הבנת הפרומפט המקורית.

מתאים ל

  • איורי קונספט ואנימה

    הוא כולל אימון ממוקד של 200,000 תמונות נוספות לסגנון אנימה ותאורה משופרת.

  • תמונות סוריאליסטיות

    הארכיטקטורה משלבת LoRA ייעודיים שנועדו לשמור על תווי פנים גם בעולמות ויזואליים חריגים.

  • רינדור ברזולוציה גבוהה

    המפתחים הגדירו מראש תמיכה מובנית ברינדור ישיר ל־1280x1280 בלי לאבד חדות.

איפה זה נופל

היוצרים ממליצים להוסיף מילות קסם כמו best quality, HD או סמלים מוזרים כדי להוציא תוצאות טובות, מה שמראה שהמודל עדיין נשען על טריקים ישנים של פרומפטים כדי לא לייצר תוצאה בינונית. אין נתוני בנצ'מרק מסודרים מול מודלים פתוחים אחרים, ואימון של 200,000 תמונות אנימה עלול לגרור הטיות חזקות לכיוון הזה גם כשמבקשים משהו ריאליסטי. תצטרכו לבדוק בעצמכם אם הוא עומד בעומס בלי להכניס ארטיפקטים של איורי אנימה לתוך תמונות רגילות.

שאלות
נפוצות

איזה סגנונות ויזואליים המודל יודע לייצר הכי טוב?

הוא מתמקד באנימה, סוריאליזם, איורי קריקטורה ותמונות פוטו־ריאליסטיות. עדכון 0.3 התמקד בעיקר בתאורה ובסגנון אנימה, תוך ניסיון לשמור על חדות הפנים והעור.

מה ההגדרות האופטימליות להרצה שלו בספריית diffusers?

צריך להגדיר דוגם DPM++ 2M SDE עם סקדיולר Karras וערך CFG של 7 עד 8. מבחינת צעדים, מכוונים ל־20 בשביל מהירות או עד 60 בשביל פירוט מקסימלי, ברזולוציה של 1024x1024 או 1280x1280.

איך מריצים

כדי להריץ אותו מקומית צריך להתמודד עם הורדה של 19.4 ג'יגה־בייט ב־28 קבצים, דרך ספריית diffusers. זה אומר שאתם חייבים כרטיס מסך חזק עם זיכרון וידאו משמעותי, במיוחד אם רוצים לרנדר ברזולוציות המומלצות של 1024x1024 או 1280x1280.

ההגדרות המומלצות דורשות בין 20 ל־60 צעדים, דוגם DPM++ 2M SDE עם מתזמן Karras ו־CFG בין 7 ל־8. אם אין לכם חומרה מתאימה להחזיק משקל כזה בזיכרון בזמן רינדור כבד, עדיף להריץ אותו דרך ספק ענן או API חיצוני.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("dataautogpt3/ProteusV0.3")
img = pipe("a photo").images[0]

הרישיון

הפרויקט מופץ תחת רישיון gpl-3.0. מדובר ברישיון קוד פתוח מדבק, שמחייב אתכם לשחרר את קוד המקור של כל מערכת שמשלבת אותו ומפיצה את עצמה הלאה, תחת אותו רישיון בדיוק. אם אתם בונים מוצר מסחרי סגור, הפצה של המודל כחלק ממנו תסבך אתכם משפטית.

הרישיון המלא בעמוד המודל ↗