GPT
O

OmniGen

רץ בדפדפן

Shitaomit2024-10-18

  • gradio
  • dwpose
  • pose
  • Text-to-Image
  • Image-to-Image

ממשק ליצירת תמונות, שינוי תנוחה וזיהוי על בסיס טקסט ותמונות קיימות. הוא מתאים למי שרוצה לבדוק יכולות של מודל תמונה אחוד בלי להתקין סביבת פיתוח מקומית.

  • הורדות בחודש
  • 705לייקים

מה זה

אתם מקלידים הנחיית טקסט ויכולים להעלות עד שלוש תמונות קלט שונות במקביל. בתוך הטקסט מתייחסים לתמונות ישירות לפי תגיות מוגדרות, והתוצאה שיוצאת היא תמונה חדשה שמבוססת על השילוב ביניהן.

מאחורי הקלעים רץ המודל Shitao/OmniGen-v1 יחד עם הרכיב stabilityai/sdxl-vae. המערך הזה בנוי לבצע משימות שונות כמו יצירה מאפס, עריכה או העברת תנוחה תחת מודל אחד, במקום לפצל את העבודה בין כמה כלים נפרדים. הממשק כולל דוגמאות מובנות שממחישות איך לסדר את הטקסט ביחס לתמונות שהעליתם.

מתאים ל

  • שינוי תנוחה של דמות

    מעלים תמונה של דמות ותמונת יעד לתנוחה, ומבקשים תמונה חדשה באותה פוזיציה.

  • יצירת תמונה מכמה מקורות

    מזינים שתיים או שלוש תמונות שונות ומשלבים אלמנטים מתוכן לתוך פריים אחד בעזרת טקסט.

  • יצירה ישירה מטקסט

    כותבים תיאור מפורט בלי לצרף תמונות ומייצרים תמונה חדשה לגמרי דרך המודל האחוד.

איפה זה נופל

ההדגמה מוגבלת לשלוש תמונות קלט בלבד, כך שאי אפשר להזין רצפים ארוכים יותר דרך הדפדפן. שילוב של מודל כבד ופרמטרים רבים כמו גודל תמונה מרבי או צעדים מרובים עלול להביא לזמני המתנה ממושכים, במיוחד אם מפעילים פינוי זיכרון מהכרטיס. אם אתם מצפים לתוצאות מיידיות בלי לכוון את ערכי ההנחיה, התוצאה עשויה לא להתאים לכוונה.

שאלות
נפוצות

האם השימוש באפליקציה עולה כסף?

לא, הגישה לממשק דרך הדפדפן פתוחה בחינם. השרת מקצה משאבי חישוב לפי זמינות, ולכן אין צורך בתשלום או בהזנת כרטיס אשראי כדי לנסות אותו.

כמה זמן לוקח לכל תמונה להיווצר?

הזמן תלוי בהגדרות כמו מספר צעדי החישוב ומידות התמונה שבחרתם בסליידרים. מאחר שהחומרה היא מסוג zero-a10g, ייתכן עיכוב ראשוני של כמה שניות להפעלת המשאבים, במיוחד אם יש משתמשים נוספים בתור.

האם אפשר להתקין ולהריץ את זה על מחשב אישי?

כן, הקוד מבוסס על ספריות פתוחות ופורסם תחת רישיון MIT עם קישור למאגר ב־GitHub. כדי להריץ אותו מקומית צריך מחשב עם מעבד גרפי תואם שיכול להחזיק את OmniGen-v1 ואת רכיב ה־VAE.

במה הממשק הזה שונה משימוש ישיר במודל?

הממשק נותן דרך גרפית פשוטה לבדוק את היכולות בלי לכתוב קוד בפייתון. מצד שני, הוא מגביל אתכם לעד שלוש תמונות קלט ולפרמטרים שמופיעים במסך, בלי אפשרות לאוטומציה מלאה.

איך משתמשים

טוענים תמונות לשדות הקלט אם רוצים, כותבים את ההנחיה בתיבת הטקסט ולוחצים על Generate Image. יש אפשרות לכוון ידנית גובה, רוחב, כמות צעדי יצירה, וערכי הנחיה נפרדים לטקסט ולתמונה. האפליקציה רצה על חומרת zero-a10g, מה שאומר שהיא מקצה כרטיס גרפי לפי דרישה. זמן הריצה מושפע מעומס כללי, מכמות הצעדים שתבחרו ומהשאלה אם המודל נטען מחדש באותו רגע.

הרישיון

הפרויקט מפורסם תחת רישיון MIT, שמאפשר שימוש חופשי בקוד, כולל התאמה לצרכים מסחריים. הקבצים והתמונות שאתם מעלים עוברים דרך השרת שמארח את ממשק ה־Gradio בזמן העיבוד, ואין כאן התחייבות לפרטיות של סביבה סגורה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗