GPT
C

Composable-Diffusion

רץ בדפדפן

Shuang59רישיון לא דווח2022-06-07

  • gradio

הדגמה שמייצרת תמונות ומודלים בתלת מימד מחיבור של כמה תיאורי טקסט במקביל. היא מיועדת לחוקרים וליוצרים שרוצים לבדוק שילוב והחרגה של הנחיות ללא אימון מחדש.

  • הורדות בחודש
  • 136לייקים

מה זה

אתם מזינים כמה תיאורי טקסט מופרדים בקו אנכי, וקובעים משקל מספרי לכל חלק, כולל ערכים שליליים להסרת אלמנטים. הממשק מחזיר תמונת דו מימד או תצוגת תלת מימד שממזגות את כל התנאים יחד. הדוגמאות המובנות מדגימות שילובים כמו טירה ביער עם ערפל מנוטרל, כנסייה עם ברקים, או שילוב בין עוגה לבית.

מאחורי הקלעים רץ יישום של מחקר מכנס ECCV 2022, שמשתמש במודלים CompVis/stable-diffusion-v1-4 ו־Point-E. הרעיון הוא הרכבה של אופרטורים לוגיים בזמן הדיגום עצמו, כך שאפשר לחבר מושגים שונים בלי לאמן את המודל על השילוב הספציפי.

מתאים ל

  • הסרת אלמנטים מתמונה

    שימוש במשקלים שליליים כדי להוריד ערפל, עננים או צבעים מתוך תיאור סצנה מורכב.

  • מיזוג מושגים בתלת מימד

    הרכבת שני תיאורים נפרדים באמצעות מודל Point-E כדי לייצר צורת תלת מימד אחת.

  • שילוב אובייקטים לפי מיקום

    הזנת קואורדינטות ומשקלים למיקום עצמים בחלל התמונה על בסיס נתוני CLEVR.

איפה זה נופל

הבעיה המיידית היא שהמרחב נמצא כעת במצב RUNTIME_ERROR, כך שאי אפשר להריץ אותו כלל דרך האתר בלי שהיוצר יתקן את הקוד. בנוסף, המודל הבסיסי הוא גרסה ישנה של סטייבל דיפיוזן מ־2022, שרחוקה מאוד מהדיוק והאיכות של כלים מודרניים.

שאלות
נפוצות

האם אפשר להשתמש באפליקציה בחינם?

כן, הממשק פתוח בחינם ברשת ולא דורש הרשמה או תשלום. עם זאת, כרגע הוא נמצא במצב שגיאה ולא מגיב. אם המפתח יתקן את השרת, הגישה תחזור לפעול ללא עלות.

כמה זמן לוקח לייצר תמונה או מודל?

החומרה שהוגדרה היא מעבד גרפי מסוג t4-medium, שאמור לספק תוצאה בתוך חצי דקה עד דקה. בפועל אי אפשר למדוד את הזמן כרגע כי המערכת קורסת בעלייה. מודלים של תלת מימד לוקחים בדרך כלל זמן ארוך יותר מתמונות רגילות.

האם אפשר להריץ את זה באופן מקומי?

כן, הקוד והמחקר זמינים במאגר הגיטהאב של הפרויקט. תצטרכו להוריד את הקבצים, להתקין את התלויות ולהחזיק כרטיס מסך מתאים בבית. זו כרגע הדרך היחידה להשתמש בשיטה הזו בגלל השגיאה בשרת המקוון.

במה זה שונה משימוש רגיל בסטייבל דיפיוזן?

בשימוש רגיל כותבים פרומפט אחד שלם ומקווים שהמודל יבין את כל ההקשרים. כאן מפרקים את התיאור לכמה חלקים עצמאיים ונותנים לכל אחד מהם משקל חיובי או שלילי ישירות בתהליך הדיגום. זה מאפשר שליטה לוגית הדוקה יותר על מה שמופיע ומה שנמחק מהתוצאה.

איך משתמשים

בפועל בוחרים בין יצירת תמונה להרכבת תלת מימד, כותבים את הפרומפטים עם המשקלים המתאימים, ולוחצים Generate. אפשר לשנות סיד ומספר צעדי דיגום בין 10 ל־200. ההדגמה מוגדרת על חומרת t4-medium, אבל כרגע היא במצב שגיאת ריצה ולא מייצרת פלט בדפדפן.

הרישיון

הרישיון לא דווח במאגר. במצב כזה אין הרשאה ברורה לשימוש מסחרי בקוד או בתוצרים, ויש לבדוק את הרישיונות של המאגר בגיטהאב ושל המודלים הבסיסיים לפני כל שימוש.

הרישיון המלא ב־Hugging Face ↗