GPT
O

OmniGen-v1

קוד פתוח

Shitaomit2024-10-21

  • diffusers
  • safetensors
  • phi3
  • image-to-image
  • text-to-image

מודל שמייצר ועורך תמונות ישירות מטקסט ומתמונות מקור. הוא חוסך שרשור של תוספים חיצוניים כמו קונטרול-נט ומבצע משימות מורכבות במעבר אחד.

  • 3.9Bפרמטרים
  • 131,072טוקנים בהקשר
  • 14.8 GBמשקל הקבצים
  • 2,225הורדות בחודש

מה זה

במקום לחבר מודל בסיס לתוספי צד כמו ControlNet או IP-Adapter כדי לשמור על דמות או להעתיק תנוחה, המודל הזה מאחד את הפעולות בארכיטקטורת שפה יחידה של Phi-3. המשקל הכולל יושב על 3.9 מיליארד פרמטרים, והוא מקבל קלט מולטי-מודאלי שמערבב טקסט ותמונות יחד.

הוא יודע לזהות מאפיינים מתוך תמונות קלט, כמו פוזה, עומק או תווי פנים, בלי שתצטרכו להריץ מודלי עזר לזיהוי מקדים. זה הופך משימות כמו עריכת תמונה, שינוי סגנון ושמירה על זהות הדמות לתהליך שמוגדר בהוראת טקסט פשוטה לצד התמונה.

מתאים ל

  • שמירה על עקביות דמות

    יצירת סדרת תמונות עם אותה הדמות ישירות מתמונת מקור אחת וללא צורך באימון LoRA ייעודי.

  • עריכת תמונה לפי הוראות

    שינוי אלמנטים מוגדרים בתמונה קיימת באמצעות פרומפט טקסטואלי ישיר בלי מסיכות מורכבות.

  • העברת תנוחה וסגנון

    העתקת פוזה או מבנה מרחבי מתמונת ייחוס לתוך יצירה חדשה במעבר חישובי יחיד.

איפה זה נופל

היוצרים מודים בגלוי שהמשאבים שלהם היו מוגבלים ויש מקום לשיפור בתוצאות. זמני הריצה מתארכים מאוד כשמזינים כמה תמונות קלט ברזולוציה מלאה, והאיכות עלולה לרדת אם לא מקפידים על הגדרות הזיכרון. אין כאן התחייבות ליציבות ברמת מוצר מסחרי, ומומלץ לבדוק את התנהגות המודל במקרי קיצון של עריכה מורכבת לפני שמסתמכים עליו.

שאלות
נפוצות

האם אפשר להריץ את המודל ישירות דרך ספריית diffusers הרגילה?

בכרטיס המודל נכתב שהתמיכה ב־diffusers תגיע בהמשך. נכון לעכשיו ההרצה המקומית מתבצעת דרך שכפול מאגר הגיטהאב והתקנת החבילה הייעודית של הפרויקט.

מה אפשר לעשות אם מקבלים שגיאת זיכרון בזמן הריצה?

הקוד כולל דגל offload_model שאפשר להפעיל כדי להוריד חלקים לזיכרון הראשי של המחשב. בנוסף מומלץ להקטין את הפרמטר שקובע את גודל תמונות הקלט המקסימלי.

איך מריצים

כדי להריץ אותו עצמאית נדרש מעבד גרפי עם זיכרון וידאו משמעותי, שכן קובצי המודל שוקלים קרוב ל־15 גיגה-בייט בפורמט bfloat16. הקוד הרשמי כולל אופציה לפריקת שכבות לזיכרון הראשי כדי למנוע קריסות זיכרון, וכן אפשר להקטין את רזולוציית התמונות הנכנסות לזירוז הריצה.

הקוד זמין דרך גיטהאב ומותקן בחבילת פייתון ייעודית, כאשר תמיכה רשמית בספריית diffusers הוגדרה ככזו שתגיע בהמשך. אם אין לכם כרטיס מסך מתאים עם לפחות 16 עד 24 גיגה זיכרון, יש הדגמות זמינות בחינם ברשת ונקודת קצה ב־Replicate.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Shitao/OmniGen-v1")
img = pipe("a photo").images[0]

הרישיון

הפרויקט מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד, לאמן אותו מחדש ולהפיץ אותו בתוך מוצרים סגורים, בתנאי ששומרים על הצהרת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗