GPT
M

MagicPrompt-Stable-Diffusion

קוד פתוח

Gustavostamit2022-09-17

  • transformers
  • pytorch
  • coreml
  • safetensors
  • gpt2

המודל הזה לוקח רעיון בסיסי לתמונה ומרחיב אותו לתיאור עשיר שמתאים לסטייל של סטייבל דיפיוז'ן. הוא קטן, זריז, ומיועד בדיוק למי שרוצה השלמת פרומפטים בלי להחזיק מודל שפה ענק.

  • 137Mפרמטרים
  • 1,024טוקנים בהקשר
  • 1.9 GBמשקל הקבצים
  • 11,368הורדות בחודש

מה זה

מדובר בהתאמה של GPT-2 שמטרתה לייצר טקסט עבור מחוללי תמונות, ספציפית סטייבל דיפיוז'ן. המפתח אימן אותו במשך 150,000 צעדים על מאגר של כ־80,000 פרומפטים שסוננו ונשלפו מתוך האתר Lexica.art. המודל שוקל 137,022,720 פרמטרים, גודל זעיר במונחים של היום, אבל המיקוד שלו צר מאוד.

במקום להמציא תשובות כלליות, הוא למד את התחביר והסגנון שהקהילה ב־Lexica השתמשה בהם כדי להוציא תמונות טובות מסטייבל דיפיוז'ן. אתם זורקים לו התחלה של רעיון, והוא משלים את שאר שורת הפקודה עם שמות אמנים, תאורה ורמת פירוט שמתאימים למנוע התמונות.

מתאים ל

  • השלמת פרומפטים למשתמשים

    הרחבת מילות מפתח קצרות לפקודות מפורטות ומלאות סגנון ישירות בממשק יצירת התמונה שלכם.

  • יצירת מאגר רעיונות

    הרצה באצווה שמייצרת מאות וריאציות של תיאורי תמונות כדי לבדוק כיוונים חדשים לסטייבל דיפיוז'ן.

  • שילוב בבוטים מקומיים

    תוספת של מודל קטן ומהיר שלא תופס מקום במערכות עם משאבי זיכרון מוגבלים.

איפה זה נופל

חלון ההקשר מוגבל ל־1,024 טוקנים, והמידע שלו מבוסס לחלוטין על הרגלי השימוש שהיו קיימים ב־Lexica.art בספטמבר 2022. הדאטה לא כולל עברית, כך שניסיון להזין קלט שאינו באנגלית ייכשל או יניב תוצאות מוזרות. מעבר לזה, אין פה מנגנוני סינון בטיחות מובנים, וכל הטיה או מילת תיאור בעייתית שהסתננה למאגר המקורי יכולה להופיע בהשלמה.

שאלות
נפוצות

האם הוא יודע לכתוב תיאורים בעברית?

לא. הדאטה נלקח מ־Lexica.art ומכיל פרומפטים באנגלית בלבד. אם תזינו לו טקסט בעברית הוא יתקשה להבין ויפלוט ג'יבריש.

האם שווה להריץ אותו מקומית או שעדיף מודל גדול יותר?

היתרון שלו הוא המשקל הנמוך, 1.9 גיגה בייט בלבד, מה שמאפשר להריץ אותו על המעבד בלי להעמיס על המערכת. אם אתם צריכים הבנה לוגית מורכבת מודלים גדולים יעשו עבודה טובה יותר, אבל בשביל השלמת ביטויים גרפיים הוא עושה את העבודה במהירות.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון תחת ארכיטקטורת GPT2LMHeadModel. הקבצים שוקלים 1.9 גיגה בייט ומגיעים בדיוק של float32, כך שאין שום צורך בכרטיס מסך מפלצתי. כל מחשב פיתוח בסיסי, ואפילו מעבד רגיל בלי מאיץ גרפי, יריץ אותו בשבריר שנייה בלי לחנוק את הזיכרון.

בגודל כזה ממש לא צריך לשלם לספק ענן חיצוני על קריאות API. קל להרים אותו מקומית כחלק מה־pipeline שלכם, לפני השליחה למחולל התמונות, ולחסוך עיכובים של רשת.

from transformers import pipeline

pipe = pipeline("text-generation", model="Gustavosta/MagicPrompt-Stable-Diffusion")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, מה שאומר שמותר להשתמש בו לצרכים מסחריים, לשנות אותו ולשלב אותו במוצרים סגורים בלי לשלם תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים ומתן קרדיט ליוצר המקורי Gustavosta.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗