GPT
P

Protogen_x3.4_Official_Release

קוד פתוח

darkstorm2150creativeml-openrail-m2023-01-02

  • diffusers
  • stable-diffusion
  • stable-diffusion-diffusers
  • text-to-image
  • art

מיזוג מודלים המבוסס על Stable Diffusion 1.5, שמכוון לסגנון צילומי ישירות מהפרומפט. הוא מתאים למי שמחפש מראה של צילום אופנה או אנלוגי בלי להסתבך עם אימונים עצמאיים.

  • 19.8 GBמשקל הקבצים
  • 728הורדות בחודש
  • 345לייקים

מה זה

במקום לאמן מודל מאפס, המפתח יצר כאן שילוב מחושב של כמה צ'קפוינטים שונים על בסיס גרסה 2.2 של הפרויקט. הנתונים מראים בדיוק ממה הוא מורכב: 42.76% מהמשקל מגיע מ Seek Art Mega, עוד 24.44% מ Modelshoot, ושאר הנפח מחולק בין מודלים כמו Elldreth, RPG v3, Openjourney ועוד כמה תוספות קטנות. המטרה של התערובת הזו היא לדחוף את התוצאות לכיוון פוטוריאליסטי בלי לאבד גמישות סגנונית.

הוא עובד באנגלית ומגיב למילות הפעלה ספציפיות שמעוררות סגנונות מוגדרים מראש, כמו צילום אנלוגי או מראה של מידג'רני. אם אתם רגילים למודל הבסיס של גרסה 1.5, כאן תראו נטייה כבדה בהרבה לתאורת סטודיו ולפרטים מורכבים בדמויות, שנובעים ישירות מהמשקלים הגבוהים של סגנון האופנה שהוזן פנימה.

מתאים ל

  • הפקת תמונות אופנה ופורטרטים

    משקלי המיזוג מכילים כמעט רבע מודל ייעודי לצילומי דוגמנות, מה שנותן תאורת סטודיו טובה.

  • הדמיות בסגנון צילום אנלוגי

    כולל תמיכה ישירה במילת ההפעלה לסגנון אנלוגי ומבוסס על מודלים שיוצרים טקסטורה של פילם.

  • יצירת דמויות מדע בדיוני ורובוטים

    השילוב של RoboDiffusion ומילות הפעלה ייעודיות מאפשר להוציא עיצובי רובוטים מפורטים.

איפה זה נופל

מכיוון שמדובר במיזוג של מודלים מרובים ולא באימון מבוקר על דאטה סט נקי, קשה לדעת בדיוק איך הוא יגיב לפרומפטים מורכבים שלא כוללים את מילות ההפעלה המוכרות. בנוסף, הוא נבנה על מודלים שמכילים עירום ותכנים למבוגרים, כמו f222 ו Hassan1.4 שמהווים ביחד כארבעה אחוזים מהמשקל, מה שאומר שהוא עלול לייצר תכנים לא הולמים בלי אזהרה מוקדמת אם לא מסננים את הפלט ברמת הקוד. הוא גם מקבל טקסט באנגלית בלבד ולא יבין פרומפטים בעברית.

שאלות
נפוצות

איזה קובץ בדיוק צריך להוריד מתוך הרשימה?

האפשרות הנוחה והבטוחה ביותר היא הקובץ המכווץ ששוקל 1.89 גיגה בייט בפורמט safetensors. הוא כולל בדיוק את אותם המשקלים הדרושים להסקה בלי מידע אימון מיותר, ונטען מהר בהרבה מהגרסה המלאה.

האם חייבים להשתמש במילות ההפעלה כדי לקבל תוצאות טובות?

לא חייבים, אבל מילות ההפעלה כמו analog style או modelshoot style מפעילות ספציפית את חלקי המיזוג הרלוונטיים. בלי המילים האלה המודל עדיין ייצר תמונות, אך המראה הצילומי יהיה פחות בולט ועקבי.

איך מריצים

המודל מגיע בכמה פורמטים, כולל קובצי safetensors ו CKPT מלאים בגודל 5.98 גיגה בייט, לצד גרסאות pruned בפורמט fp16 ששוקלות 1.89 גיגה בייט בלבד. בשביל להריץ אותו מקומית צריך כרטיס מסך עם לפחות שמונה גיגה בייט זיכרון גרפי, ועדיף להוריד ישירות את קובץ ה safetensors המכווץ כדי לחסוך מקום ומשאבים.

אפשר לטעון אותו בספריית diffusers של פייתון או פשוט לזרוק את הקובץ לתיקיית המודלים של WebUI. אם המטרה היא להפיק כמה תמונות בודדות ולא לתחזק שרת, יש לו גרסת הדגמה בחינם ב Gradio Spaces שמריצה אותו בלי שום התקנה מקומית.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("darkstorm2150/Protogen_x3.4_Official_Release")
img = pipe("a photo").images[0]

הרישיון

הרישיון הרשמי הוא CreativeML OpenRAIL-M, שמתיר שימוש מסחרי אבל מטיל הגבלות ברורות נגד יצירת תוכן פוגעני או מטעה, ומחייב להעביר את אותן מגבלות הלאה. בנוסף, בעמוד המודל מצוין שבהורדה מסכימים גם לתנאי הרישיון של Seek Art Mega בגלל המיזוג, מה שמחייב לבדוק את התנאים שלהם לפני שמשלבים את המשקלים במוצר מסחרי סגור.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗