GPT
O

OmniGen2

קוד פתוח

OmniGen2apache-2.02025-06-06

  • diffusers
  • safetensors
  • any-to-any

מודל מולטימודלי של 4B פרמטרים שמשלב הבנת תמונה, יצירה ועריכה מבוססת טקסט. הוא מתאים למי שרוצה עריכת תמונות מונחית הוראות בלי לתחזק שרשרת מודלים נפרדת.

  • 4Bפרמטרים
  • 29.1 GBמשקל הקבצים
  • 3,091הורדות בחודש
  • 452לייקים

מה זה

הארכיטקטורה מבוססת על Qwen-VL-2.5 כבסיס להבנה חזותית, אך מפרידה לחלוטין את מסלולי הפענוח של הטקסט והתמונה עם פרמטרים לא משותפים וטוקנייזר תמונה נפרד. הפיצול הזה מאפשר לו לבצע ארבע משימות מרכזיות במערכת אחת: הבנת תמונה, יצירה מטקסט, עריכת תמונות מונחית הוראות ויצירה מבוססת הקשר שמשלבת מספר תמונות מקור לפלט חדש.

היתרון המעשי כאן הוא היכולת לבצע מניפולציות מורכבות על בסיס כמה תמונות קלט בלי להזדקק לכלים חיצוניים כמו ControlNet. במקום להחזיק מודל נפרד לפענוח הפרומפט ומודל נפרד לדיפוזיה, המערכת הזו מטפלת בהזנת תמונות רפרנס ומיזוג ישויות ישירות בתוך ההקשר. הפרויקט מספק תמיכה מובנית בטכניקות האצה כמו TeaCache וחיבור ישיר ל־ComfyUI, מה שמקל על שילוב שלו בתהליכי עבודה קיימים בקוד פתוח.

מתאים ל

  • עריכת תמונות מהוראות טקסט

    שינוי אלמנטים בתמונה קיימת ישירות מתוך הנחיה טקסטואלית, ללא צורך במסכות ידניות.

  • שילוב ישויות ממספר מקורות

    לקיחת דמות מתמונה אחת וחפץ מתמונה שנייה כדי לייצר סצנה חדשה לגמרי ששומרת על מאפייני המקור.

  • עבודה מקומית ב־ComfyUI

    הרצת תהליכי יצירה משולבים ישירות בממשק ComfyUI נתמך, על גבי כרטיס ביתי של 24GB.

איפה זה נופל

היוצרים מבהירים שהמערכת מותאמת כרגע לעבודה באנגלית, ולכן פרומפטים בעברית צפויים להניב תוצאות פחות טובות או להתעלם מחלק מההוראות. איכות הפלט תלויה מאוד ברזולוציית הקלט, כך שתמונות מתחת ל־512 על 512 פיקסלים מייצרות פגמים ברורים. בנוסף, בעריכה או יצירה מורכבת נדרש ניסוח מדויק מאוד שמגדיר איזה אובייקט מגיע מאיזו תמונת מקור, והמערכת דורשת משחק ידני עדין עם משקלי ההנחיה של התמונה והטקסט כדי להימנע מהתעלמות מהפרומפט או משינויים אגרסיביים מדי.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב נייד או כרטיס מסך ביתי חלש?

אפשר להריץ אותו גם עם פחות מ־3GB זיכרון וידאו באמצעות הפעלת sequential cpu offload. עם זאת, התהליך יהיה אטי מאוד ולא מעשי לעבודה שוטפת, ולכן מומלץ להחזיק לפחות 12 עד 16GB זיכרון כדי לעבוד עם offload רגיל.

איך משפיע היחס בין משקל הטקסט למשקל התמונה על התוצאה?

הפרמטר image guidance scale קובע כמה הפלט יישאר נאמן למקור, כאשר ערך גבוה מדי ישמור על התמונה המקורית ויתעלם מהוראות הטקסט. לעריכה מומלץ לקבוע ערכים נמוכים בין 1.2 ל־2.0, וביצירת הקשר עדיף לעלות לאזור 2.5 כדי לא לאבד פרטים.

איך מריצים

כדי להריץ אותו בצורה מקורית צריך כרטיס מסך ברמה של RTX 3090 עם כ־17GB זיכרון וידאו פנוי. אם עובדים על חומרה חלשה יותר, אפשר להפעיל Model CPU Offload שמוריד את צריכת הזיכרון בחצי כמעט בלי לפגוע במהירות, או להשתמש ב־Sequential Offload שמאפשר ריצה על פחות מ־3GB זיכרון וידאו, אך משלם על כך בהאטה חריפה מאוד של זמני היצירה.

ההתקנה דורשת סביבת פייתון 3.11, פייטרוץ' וספריות תואמות CUDA, כאשר ניתן להוסיף flash-attn לביצועים מרביים אך המודל פועל גם בלעדיו. אם אין לכם גישה לכרטיס ייעודי עם נפח זיכרון מתאים, עדיף להשתמש בדמו הציבורי ב־Hugging Face Spaces או לקרוא לשירות ענן מרוחק במקום לנסות לייצר תמונות על מעבד מקומי.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("OmniGen2/OmniGen2")
img = pipe("a photo").images[0]

הקבצים

41 קבצים במאגר, 29.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 המלא. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והמשקלים, והפצה מחדש בתוך מוצרים פרטיים. התנאי העיקרי הוא שמירת הודעות זכויות היוצרים והרישיון המקורי, ללא דרישה לחשוף קוד קנייני שנבנה סביבו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗