GPT
D

d-edit

רץ בדפדפן

Collov-Labsרישיון לא דווח2024-09-04

  • gradio
  • image-editing
  • diffusion
  • research

עריכת אובייקטים ממוקדת בתמונות לפי טקסט, המיועדת לחוקרים שרוצים לבחון את שיטת D-Edit. מעלים תמונה, מבודדים אזור בעזרת מסכה ומחליפים אותו לפי תיאור כתוב.

  • הורדות בחודש
  • 84לייקים

מה זה

האפליקציה מבצעת עריכה מונחית טקסט על גבי תמונה קיימת. אתם מעלים תמונה לקנבס, והשלב הראשון מריץ חלוקה למקטעים כדי לחלץ מסכות של האובייקטים השונים. מתוך המקטעים שנוצרו בוחרים מזהה מסכה ספציפי, ומזינים טקסט שמתאר את השינוי המבוקש באותו אזור.

מאחורי הקלעים רץ המודל CompVis/stable-diffusion-v1-4. במקום סתם להחליף פיקסלים בריסוס עיוור, התהליך מבצע אופטימיזציה מקומית. הוא מייצג כל אובייקט באמצעות מספר מוגדר של אסימונים, ברירת המחדל היא חמישה, ומאמן את ההטמעות לצד רשת ה־UNet של מודל הדיפוזיה. הקוד כולל הגדרות מתקדמות להתאמת קצבי הלמידה, צעדי האימון ודגימת הדיפוזיה.

מתאים ל

  • עריכת אובייקט בודד

    בידוד פריט מתוך תמונה קיימת והחלפתו באובייקט אחר לפי תיאור טקסטואלי.

  • בדיקת אימון הטמעות

    ניסוי בהשפעת מספר האסימונים וצעדי האימון על דיוק העריכה במודל דיפוזיה.

  • מחקר על D-Edit

    בחינה מעשית של שיטת המאמר האקדמי שפורסם בארכייב ישירות דרך ממשק גרפי.

איפה זה נופל

האפליקציה הזאת היא הדגמת מחקר ולא כלי עבודה מהיר. היא מוגבלת לבקשה אחת בתור עם גודל אצווה של אחד, מה שאומר שכל פעולה דורשת המתנה ממושכת. המודל שמתחת הוא גרסה ישנה, סטייבל דיפיוז'ן אחת נקודה ארבע, כך שאיכות הטקסטורות והדיוק ירודים משמעותית ממודלים מודרניים. בנוסף, חלוקת המקטעים האוטומטית לא תמיד פוגעת בדיוק באובייקט שרציתם, ואין כלי מובנה לציור ידני חופשי של מסכה.

שאלות
נפוצות

האם השימוש באפליקציה עולה כסף?

הגישה לממשק דרך הדפדפן היא בחינם. עם זאת, האפליקציה נמצאת במצב שינה על חומרת מעבד בסיסית. ייתכן שתצטרכו להעיר אותה או לשכפל את המרחב לחומרה שלכם כדי להריץ את שלבי ה־CUDA.

כמה זמן לוקח לכל עריכה להסתיים?

התהליך אינו מיידי ונמשך כמה דקות. החלוקה למקטעים רצה על המעבד, ולאחר מכן יש צעדי אימון לרשת הדיפוזיה לפני שלב יצירת התמונה הסופית. בנוסף, התור מוגבל לבקשה אחת בלבד בכל רגע נתון.

האם אפשר להריץ את הקוד באופן מקומי?

כן, הקוד הציבורי מבוסס על פייתון וגרדיו וזמין במאגר. כדי להריץ אותו בהצלחה מקומית תצטרכו כרטיס מסך של שש עשרה גיגה-בייט לפחות, דוגמת אנבידיה T4, התומך בסביבת CUDA.

במה האפליקציה שונה מהרצת המודל הרגיל?

במקום יצירת תמונה חדשה מאפס, הממשק מחלק את התמונה שלכם לחלקים בעזרת מסכות. לאחר מכן הוא מאמן את הטמעת האובייקט ומשקלי ה־UNet כדי לשנות רק את האזור המסומן בלי להרוס את הרקע.

איך משתמשים

טוענים תמונה או בוחרים דוגמה, ולוחצים על כפתור החלוקה למקטעים. אחרי שהמסכות נוצרות, בוחרים את מספר המסכה הרצויה, כותבים את הפרומפט, ומפעילים את שלבי האופטימיזציה והעריכה. האפליקציה נמצאת במצב שינה ומוגדרת על מעבד בסיסי, כך שנדרשת הערה שלה לפני שמתחילים. החלוקה למקטעים רצה על המעבד, אך שלב האופטימיזציה והעריכה דורש CUDA ומתוכנן לעבוד עם תור של בקשה בודדת בכל פעם כדי להתאים למעבד גרפי בנפח שש עשרה גיגה-בייט.

הרישיון

הרישיון לא דווח במאגר. המשמעות היא שאין הרשאה ברורה לשימוש מסחרי, וכל זכויות הקוד והפיתוח שייכות למפרסמים. המודל הבסיסי עצמו כפוף לתנאי השימוש המקוריים של סטייבל דיפיוז'ן.

הרישיון המלא ב־Hugging Face ↗