GPT
P

ProteusV0.2

קוד פתוח

dataautogpt3gpl-3.02024-01-19

  • diffusers
  • text-to-image
  • endpoints_compatible

זהו שדרוג של OpenDalle שמכוון להתחרות ב־Midjourney v6 ביצירת תמונות. הוא נבנה כדי לתת תוצאות טובות יותר בהבנת טקסט, עור פנים ואסתטיקה של אנימה.

  • 19.4 GBמשקל הקבצים
  • 16,305הורדות בחודש
  • 147לייקים

מה זה

הבסיס כאן הוא שיפור של OpenDalleV1.1 שעבר כוונון עדין על 220,000 תמונות סטוק חופשיות עם תיאורי GPTV, לצד אופטימיזציית DPO על 10,000 זוגות תמונות שנבחרו בקפידה. היוצר שילב בפנים מודלי LoRA שונים באופן דינמי כדי לחדד פרטים כמו מרקם עור ותווי פנים, מבלי לפגוע ביכולות סגנוניות אחרות.

בגרסה 0.2 נוסף מיזוג של חצי אחוז בלבד עם RealCartoonXL בשיטת slerp. המטרה של המהלך הזה הייתה לפתור בעיה ממוקדת של חוסר הבנה בתגיות של אנימה וסגנון מצויר. הטענה המרכזית בכרטיס היא שהמודל מבין פרומפטים טוב יותר מ־MJ6 ומגרד את היכולות הסגנוניות שלו, אם כי מדובר בהצהרה של המפתח שצריך לבדוק בעיניים.

מתאים ל

  • תמונות פנים ריאליסטיות

    האימון כלל LoRA ייעודי לשיפור מרקם עור ותווי פנים עדינים.

  • איורי אנימה וסגנון מצויר

    המיזוג עם RealCartoonXL נועד ישירות לשפר הבנת תגיות אנימה.

  • הפקת תמונות סוריאליסטיות

    אימון ה־DPO כוון מראש לתת מענה לסגנונות אסתטיים ייחודיים.

איפה זה נופל

למרות הטענות להבנת הנחיות מתקדמת, המפתח עצמו ממליץ להוסיף מילות מפתח ישנות כמו best quality או HD כדי לקבל תוצאות טובות, מה שמעיד על תלות בטריקים של מודלים ישנים יותר. בנוסף, המיזוג עם RealCartoonXL נועד לתקן פגם נקודתי בסגנונות אנימה, כך ששווה לבדוק אם הסגנון הכללי לא נוטה עכשיו למראה מצויר גם כשלא ביקשתם.

שאלות
נפוצות

אילו הגדרות צריך לתת למנוע כדי לקבל תוצאה אופטימלית?

היוצר מכוון להרצה עם הדוגם DPM++ 2M SDE וסקדיולר Karras. מומלץ לעבוד בטווח של 20 עד 60 צעדים, עם CFG בין 7 ל־8, וברזולוציה של 1024x1024 ומעלה.

האם מותר לשלב את המודל בתוכנה מסחרית קניינית?

לא בפשטות. רישיון GPL 3.0 דורש שכל תוכנה שמפיצה את המודל או מבוססת עליו תהיה פתוחה באותו אופן, ולכן הוא לא מתאים לפרויקטים מסחריים סגורים.

איך מריצים

מדובר במשקל כולל של 19.4 ג'יגה־בייט ב־38 קבצים, שרצים דרך ספריית diffusers. כדי לייצר תמונות ברזולוציות המומלצות של 1024x1024 או 1280x1280 תצטרכו כרטיס מסך חזק עם מספיק VRAM, לפחות 16 עד 24 ג'יגה־בייט, בדומה למודלי SDXL כבדים.

היוצר ממליץ על הדוגם DPM++ 2M SDE עם סקדיולר Karras, ערך CFG שבין 7 ל־8, ובין 20 ל־60 צעדים לפי הצורך ברמת הפירוט. אם אין לכם חומרה ייעודית מקומית שמוכנה לעומס כזה, החזקת שרת פרטי בשבילו תעלה לא מעט ביחס לשימוש בממשק מוכן.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("dataautogpt3/ProteusV0.2")
img = pipe("a photo").images[0]

הרישיון

המודל מופץ תחת רישיון GPL 3.0. מדובר ברישיון קוד פתוח מגביל שמחייב שיתוף קוד, מה שאומר שאם תפיצו מוצר שכולל את המודל או נגזרות שלו, תצטרכו לשחרר את קוד המקור תחת אותו רישיון בדיוק. לשימוש מסחרי סגור זה עשוי להוות בעיה משפטית רצינית.

הרישיון המלא בעמוד המודל ↗