GPT
M

ml-mgie

רץ בדפדפן

tsujuifuother2024-02-06

  • gradio

עריכת תמונות באמצעות הוראות טקסט חופשיות שמפוענחות על ידי מודל שפה גדול. מתאים למי שרוצה לשנות אלמנטים בתמונה בלי להסתבך עם מסכות או פוטושופ.

  • הורדות בחודש
  • 332לייקים

מה זה

אתם מעלים תמונה וכותבים הוראת עריכה קצרה בתיבת הטקסט. במקום להעביר את הטקסט שלכם ישירות למודל הציור, מודל שפה מבוסס LLaVA מרחיב את הבקשה להנחיה מפורטת ומדויקת יותר, שמוצגת בתיבה נפרדת. משם ההוראה המורחבת נשלחת יחד עם התמונה המקורית לצנרת של Instruct-Pix2Pix ו־Stable Diffusion 1.5, שמייצרת את תמונת היעד.

הממשק כולל גם בקרות מספריות עבור Seed, Text CFG שמוגדר כברירת מחדל ל־7.5, ו־Image CFG שעומד על 1.5. יש גם דוגמאות מובנות מתוך קובצי קלט קיימים כדי לבדוק איך המערכת מפרשת הוראות שונות בלי להעלות קובץ משלכם.

מתאים ל

  • עריכת פרטים בתמונה

    מעלים תמונה קיימת ומבקשים להוסיף, למחוק או לשנות עצמים מסוימים לפי הוראה מילולית.

  • פירוט הנחיות עמומות

    כותבים פקודה קצרה ורואים איך מודל השפה מרחיב אותה להוראה ויזואלית ברורה.

  • בדיקת פרמטרי CFG

    משנים את יחסי ההשפעה של הטקסט והתמונה המקורית כדי להגיע לאיזון הנכון בעריכה.

איפה זה נופל

הבעיה המיידית היא שהאפליקציה נמצאת במצב שגיאת ריצה ולא עובדת כרגע בדפדפן. מעבר לזה, התמונות נחתכות או מותאמות לגודל של 384 על 384 פיקסלים, כך שלא תקבלו כאן פלט ברזולוציה גבוהה. המודל מסתמך על Stable Diffusion 1.5 ו־Instruct-Pix2Pix, כך ששינויים מורכבים במיוחד עדיין עשויים לעוות חלקים שלא ביקשתם לגעת בהם.

שאלות
נפוצות

האם השימוש באפליקציה כרוך בתשלום?

לא, הגישה לממשק בחינם. עם זאת, הוא נשען על מכסות שימוש רגילות של חומרת Zero GPU. מעבר לכך, נכון לעכשיו הוא ממילא קורס בהרצה.

כמה זמן לוקח לכל עריכה להסתיים?

במצב עבודה תקין, מעבד A10G מייצר תמונה תוך שניות בודדות. כרגע לא ניתן למדוד זמנים מדויקים בגלל שגיאת הריצה של השרת. בנוסף, בעומס ייתכן שתמתינו בתור להקצאת החומרה.

האם אפשר להריץ את זה באופן מקומי במחשב שלי?

כן, הקוד טוען את המשקלים ממאגר ml-mgie ומשתמש בספריות סטנדרטיות של transformers ו־diffusers. תצטרכו כרטיס מסך של Nvidia עם מספיק זיכרון כדי להחזיק את מודל השפה ואת מודל הדיפוזיה יחד ב־float16.

במה הממשק הזה שונה משימוש ישיר ב־Instruct-Pix2Pix?

הוא מוסיף שלב תרגום חכם לפני יצירת התמונה. מודל LLaVA מפרש את כוונת המשתמש ומנסח אותה מחדש כהנחיה עשירה ומפורטת, במקום להסתמך רק על המשפט הקצר שכתבתם.

איך משתמשים

גוררים תמונה לתיבת הקלט, מקלידים הוראה, ולוחצים על Submit. הקוד רץ על חומרת zero-a10g שמקצה מעבד גרפי A10G לפי דרישה, ומפעיל בודק בטיחות של CompVis על התוצאות. אין כאן דרישת התחברות ייעודית בתוך הממשק, אבל בזמן שצפינו בו הוא מוגדר במצב RUNTIME_ERROR, כך שכרגע אי אפשר להריץ אותו בפועל עד שיועלה תיקון.

הרישיון

הרישיון מוגדר בתור other, בלי פירוט נוסף בקוד או בתיעוד. המשמעות היא שאין הרשאה ברורה לשימוש מסחרי, ואין מידע לגבי שמירת התמונות שאתם מעלים לשרת.

הרישיון המלא ב־Hugging Face ↗