GPT
D

Diffree

רץ בדפדפן

LiruiZhaomit2024-07-22

  • gradio

הכלי מוסיף אובייקטים חדשים לתמונות קיימות על בסיס תיאור טקסט בלבד. הוא מתאים למי שרוצה לשלב אלמנטים ברקע בלי לצייר מסיכות ידניות.

  • הורדות בחודש
  • 137לייקים

מה זה

מעלים תמונה קיימת ומקלידים תיאור טקסטואלי של האובייקט שרוצים להוסיף. הממשק מאפשר גם להזין רשימת פריטים, שורה אחר שורה, כדי לייצר כמה תוספות ברצף. בתמורה מקבלים תמונה משולבת עם האובייקט החדש, מסיכה שמראה איפה השינוי בוצע, וגרסה נוספת של התוצאה שמדגישה את המיקום באדום. יש גם אפשרות לצפות בסרטון שמציג את שלבי היצירה של התמונה והמסיכה.

מאחורי הקלעים רץ מודל דיפוזיה מסוג Diffree, שמבצע inpainting מונחה טקסט בלי צורך בהגדרה מראש של צורת האובייקט. המערכת משתמשת במודלים של CLIP ו־BERT לעיבוד ההנחיות והתאמתן להקשר המרחבי, לצד בודק בטיחות של Stable Diffusion שמסנן את הפלט. בממשק מוטמעות דוגמאות מוכנות מראש, אך הן אינן נשמרות במטמון ודורשות הרצה ישירה.

מתאים ל

  • הוספת פריט לתמונה

    שותלים אובייקט בודד בתוך תמונה לפי תיאור מילולי קצר, בלי לסמן אזור מראש.

  • הזנת רשימת פריטים

    מייצרים רצף של אובייקטים מרובים לתוך אותה תמונה באמצעות קלט טקסט של שורה אחר שורה.

  • חילוץ מסיכת מיקום

    מקבלים את מסיכת המיקום המדויקת שנוצרה עבור האלמנט כדי להמשיך עריכה בתוכנה חיצונית.

איפה זה נופל

הבעיה המיידית היא שהמרחב פשוט לא עובד כרגע בגלל שגיאת בנייה בעמוד. מעבר לכך, הקוד מוגדר לרוץ על מעבד בסיסי, מה שאומר שעיבוד של 100 צעדי דיפוזיה או יצירת סרטוני תהליך ייקחו זמן ממושך מאוד אם וכאשר המרחב יחזור לפעול. ההדגמה מתמקדת בהוספת אובייקט חדש בלבד, ולא בעריכה כללית, מחיקה או שינוי של אלמנטים קיימים בתמונה המקורית.

שאלות
נפוצות

האם אפשר להשתמש באפליקציה כרגע בדפדפן?

לא. האפליקציה נמצאת במצב BUILD_ERROR, ולכן הממשק אינו זמין להרצה עד שהיוצר יתקן את בעיית הבנייה.

האם אפשר להריץ את המודל באופן עצמאי?

כן. הקוד זמין ב־GitHub ומשקולות המודל זמינות להורדה ב־Hugging Face תחת המשתמש LiruiZhao, כך שניתן להתקין אותו בסביבה מקומית עם מעבד גרפי מתאים.

כמה זמן לוקח לייצר תמונה בממשק הזה?

ברירת המחדל היא 100 צעדים, ובממשק מצוין מפורשות שזמן הריצה מתארך ככל שמוסיפים פריטים ברשימה. בהתחשב בחומרת המעבד הבסיסית שמוגדרת למרחב, מדובר בתהליך ארוך במיוחד.

איך משתמשים

טוענים תמונה לחלון הקלט, כותבים תיאור קצר ולוחצים על כפתור Generate, או מזינים רשימה ולוחצים על List Generate. אפשר לכוונן ידנית את מספר הצעדים שמוגדר כברירת מחדל ל־100, לקבוע ערכי CFG לטקסט ולתמונה, או לשנות את הסיד. כרגע לא ניתן להריץ את ההדגמה הזו בפועל מפני שהיא תקועה במצב של שגיאת בנייה BUILD_ERROR, והחומרה שמוקצית לה היא מעבד בסיסי בלבד.

הרישיון

הקוד מפורסם תחת רישיון MIT, מה שמאפשר שימוש חופשי, שינוי והפצה, כולל לצרכים מסחריים. אין פירוט לגבי שמירה או שימוש בתמונות שמועלות למרחב.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗