GPT
M

multiple-characters

קוד פתוח

YaoJiefuapache-2.02025-11-04

  • diffusers
  • image-to-image

הורדה קטנה של לורה שמיועדת להוספת כמה דמויות לתוך תמונה קיימת. הפתרון מתאים למי שרוצה לשלב קבוצות אנשים בזוויות שונות לפי תיאור טקסטואלי חופשי.

  • 225 MBמשקל הקבצים
  • 2,186הורדות בחודש
  • 66לייקים

מה זה

מדובר במשקולת לורה שמבוססת על Qwen-Edit-2509 ונועדה למשימות תמונה לתמונה. המטרה המרכזית פה היא הוספת כמה אנשים בבת אחת לתוך סצנה קיימת, תוך ניסיון להתאים אותם לזווית הצילום של הרקע, כולל זוויות מורכבות כמו צילום מאחור.

השליטה נעשית באמצעות הנחיות טקסט באנגלית שמתארות מי נוסף לתמונה ואיפה, כמו למשל משפחה בסלון או אנשים שיושבים על ספה. היוצר שיתף סרטון הדגמה וקישור לסביבת עבודה מקוונת ברשת, אבל לא פרסם מבחני ביצועים כמותיים או ציונים רשמיים, כך שאיכות הפלט נשענת בעיקר על הגיפים והדוגמאות שהועלו לעמוד.

מתאים ל

  • הוספת קבוצות אנשים לתמונה

    שילוב משפחה או כמה אנשים יחד בחדר קיים לפי הנחיית טקסט ישירה.

  • התאמת דמויות מזווית גב

    יצירת דמויות שיושבות עם הגב למצלמה ומשתלבות במבנה הקיים של הסצנה.

  • בדיקת שילוב בלורה קלה

    תוספת של 225 מגה בייט בלבד מעל תשתית דיפיוזרס קיימת בלי להוריד מודל ענק.

איפה זה נופל

הכרטיס לא מספק נתונים טכניים על אובדן איכות, מגבלות רזולוציה או דיוק בפרצופים ובידיים. תצטרכו לנסח פרומפטים מדויקים באנגלית כדי לקבל מיקום הגיוני של הדמויות, ואין מידע לגבי התנהגות המודל כשיש כבר אנשים אחרים ברקע או בסצנות עמוסות במיוחד.

שאלות
נפוצות

אפשר להריץ את הקבצים האלה כמודל עצמאי?

לא. מדובר במשקולת לורה שדורשת את מודל הבסיס של קוון כדי לעבוד, ותצטרכו לטעון את שניהם יחד בסביבת דיפיוזרס.

איך מגדירים לו איפה לשים את האנשים?

השליטה מתבצעת כרגע רק דרך תיאור מילולי בפרומפט, למשל בקשה לאנשים שיושבים על הספה או עומדים בחלל מסוים בתמונה.

איך מריצים

המשקל הכולל של ארבעת הקבצים הוא 225 מגה בייט בלבד, כך שההורדה מהירה מאוד. מכיוון שזו לורה לספריית דיפיוזרס ולא מודל בסיס שלם, אתם צריכים לטעון אותה מעל המודל הראשי המתאים, Qwen-Edit-2509, ולא להריץ אותה לבד באוויר.

דרישות הזיכרון והחומרה בפועל ייקבעו לפי מודל הבסיס שעליו תלבישו את המשקולות. מי שלא רוצה להגדיר סביבת פייתון מקומית עם כרטיס מסך מתאים יכול לבדוק את התהליך דרך הקישור שהיוצר השאיר לפלטפורמת ראנינגהאב.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("YaoJiefu/multiple-characters")
img = pipe("a photo").images[0]

הקבצים

4 קבצים במאגר, 225 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מפורסם תחת רישיון אפאצ'י 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקבצים ולשלב אותם בקוד סגור, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗