GPT
S

sdxl-emoji

קוד פתוח

fofrcreativeml-openrail-m2024-06-20

  • diffusers
  • text-to-image
  • stable-diffusion
  • lora

התאמת LoRA קטנה ל־SDXL שמייצרת אימוג'ים בסגנון המוכר של אפל. היא שוקלת 177 מגה בלבד ומתלבשת ישירות על המודל הבסיסי.

  • 177 MBמשקל הקבצים
  • 127הורדות בחודש
  • 614לייקים

מה זה

מדובר באימון עדין מסוג LoRA שמיועד למשימת יצירת תמונות מטקסט, ספציפית במראה של האימוג'ים של אפל. היוצר fofr השתמש כאן בשיטה שנקראת Pivotal Tuning, שמשלבת אימון קונספט של Dreambooth עם הוספת טוקנים חדשים בגישת Textual Inversion. התוצאה היא קובץ קל מאוד ביחס למודלים מלאים, שנועד לייצר גרפיקות קטנות ומדויקות בסגנון אחיד.

במקום לנסות להנדס פרומפטים מורכבים ב־SDXL רגיל כדי לקבל גרפיקה וקטורית תלת־ממדית נקייה, המודל הזה מחזיק את הסגנון מראש. כדי להפעיל את הסגנון משתמשים במילות הפעלה ייעודיות, או במחרוזת שמוגדרת בכרטיס, והוא מושך את הוויזואליה של אפל בלי צורך לתאר את כל חוקי התאורה וההצללה של הממשק בכל פעם מחדש.

מתאים ל

  • מחולל אימוג'י מותאם אישית

    יצירת סמלים ופרצופים חדשים שלא קיימים במקלדת, תוך שמירה על המראה הוויזואלי המוכר של מכשירי אפל.

  • מדבקות לאפליקציות צ'אט

    ייצור מהיר של חבילות סטיקרים בסגנון אחיד ונקי ישירות מתוך תיאורי טקסט.

  • אייקונים לממשקי משתמש

    הפקת אלמנטים גרפיים מבודדים על רקע פשוט עבור כפתורים, תגיות או תפריטים במערכות פנימיות.

איפה זה נופל

האינטגרציה המקומית בקוד מסורבלת מהרגיל. diffusers לא תומך ישירות ב־Textual Inversion עבור SDXL כמו שנעשה פה, ולכן חייבים לשבץ מחלקה ייעודית בשם TokenEmbeddingsHandler ולשלוף קוד ממאגר חיצוני. מעבר לזה, המודל אומן על סגנון מאוד ספציפי של אפל, כך שאי אפשר לצפות ממנו להפיק סגנונות איור אחרים או תמונות פוטו־ריאליסטיות. מי ששוכח להזין את הטוקנים המדויקים, פשוט לא יקבל את האפקט.

שאלות
נפוצות

האם אפשר להריץ את זה על מחשב בלי כרטיס מסך ייעודי?

לא מומלץ בכלל. הקובץ עצמו קטן, אבל הוא דורש את מודל הבסיס SDXL שחייב משאבי עיבוד כבדים וזיכרון וידאו משמעותי. במצב כזה עדיף להשתמש ב־API של Replicate ולשלם לפי קריאה במקום לקרוס על המעבד המקומי.

איך גורמים למודל לייצר דווקא בסגנון האימוג'י של אפל?

בזמן כתיבת הפרומפט חובה להכניס את מילות ההפעלה הייעודיות, כמו שמופיע בדוגמאות הקוד של המודל. ללא הטוקנים האלה, המערכת תתייחס לבקשה כמו אל יצירה רגילה ב־SDXL ולא תחיל את משקלי ה־LoRA כמו שצריך.

איך מריצים

המשקל של הקבצים עומד על 177 מגהבייט בסך הכול, אבל צריך לזכור שזה רק מתאם. כדי להריץ אותו מקומית עם ספריית diffusers אתם חייבים לטעון ברקע את מודל הבסיס SDXL, מה שדורש כרטיס מסך רציני עם מספיק זיכרון וידאו, לרוב באזור 12 עד 16 גיגהבייט לפחות. בנוסף, בגלל השילוב של הטוקנים המיוחדים, המימוש ב־diffusers דורש קוד חיצוני נוסף מתוך מאגר cog-sdxl לטיפול בהטמעות.

אם אין לכם כרטיס מתאים או שאתם לא רוצים להסתבך עם הגדרות הסביבה והתלויות, אפשר פשוט לקרוא לו דרך ה־API של Replicate בעזרת ספריית הפייתון שלהם או ב־Node.js. במקרים של שימוש מזדמן או שילוב מהיר במוצר קיים, ה־API חוסך את כל התחזוקה של השרת.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("fofr/sdxl-emoji")
img = pipe("a photo").images[0]

הקבצים

5 קבצים במאגר, 177 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא CreativeML OpenRAIL-M. הרישיון הזה מתיר שימוש מסחרי, אבל מטיל שורה של הגבלות על אופי השימוש, בעיקר איסור על יצירת תוכן מזיק, מטעה או פוגעני. אם אתם משלבים את זה באפליקציה, אתם מחויבים להעביר את אותן הגבלות שימוש גם למשתמשי הקצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗