GPT
M

Ming-flash-omni-2.0

קוד פתוח

inclusionAImit2026-02-10

  • diffusers
  • onnx
  • safetensors
  • bailingmm_moe_v2_lite
  • any-to-any

מודל MoE מולטימודלי של 104 מיליארד פרמטרים שמקבל תמונה, וידאו, טקסט וקול, ומייצר תמונה, טקסט ושמע. היתרון שלו הוא ארכיטקטורה שמפעילה רק 6 מיליארד פרמטרים בכל שלב.

  • 104Bפרמטרים
  • 222 GBמשקל הקבצים
  • 3,365הורדות בחודש
  • 274לייקים

מה זה

הארכיטקטורה מבוססת על Ling-2.0, מודל תערובת מומחים עם 104 מיליארד פרמטרים בסך הכל, כשבפועל רצים רק 6 מיליארד בכל חישוב. המבנה הזה נותן מהירות תגובה של מודל קטן עם קיבולת ידע של רשת ענקית. המשימה המוגדרת היא any-to-any, כלומר אפשר להזין קלט בכל שילוב של מדיה ולקבל פלט של תמונות, שמע וטקסט בלי להחליף מודלים בדרך.

הייחוד נמצא בשילוב של ראש Diffusion Transformer עם רגרסיה אוטומטית רציפה ליצירת קול, מה שמאפשר שכפול קול באפס דוגמאות מוקדמות ושליטה ישירה ברגש ובמוזיקה. בצד הוויזואלי הוא מחבר יצירה, פילוח ועריכת תמונה תחת אותו מודל, כך שהוא מטפל במחיקת אובייקטים והרכבת סצנות תוך שמירה על עקביות של עומק ומרקם.

מתאים ל

  • עריכת תמונות מורכבת

    מאחד פילוח, מחיקת אובייקטים והשלמת רקע במודל בודד ששומר על עומק וטקסטורה.

  • הפקת דיבוב וסאונד

    מייצר דיבור ומוזיקה עם שליטה ברגשות ושכפול קול בלי צורך באימון מוקדם.

  • ניתוח מולטימודלי רציף

    מאפשר שיחה חיה מול הזרמת וידאו עם מענה קולי מהיר בזכות 6 מיליארד פרמטרים פעילים.

איפה זה נופל

ההורדה כוללת 98 קבצים בנפח עצום, מה שהופך את הפריסה לאיטית ומסורבלת, במיוחד מחוץ לסין איפה שהשרתים של ModelScope פחות מהירים. בנוסף, המודל מוגדר רשמית רק באנגלית (en), ולמרות שהוא כולל יכולות זיהוי דיאלקטים שצוינו במחקר, אין שום התייחסות לתמיכה בעברית או באיכות הפלט שלה. תיעוד הריצה דל מאוד ומפנה רק לקובץ מחברת בודד, כך שאין עדיין פתרונות מובנים להרצה בייצור רחב היקף.

שאלות
נפוצות

אפשר להריץ את זה על מחשב פיתוח חזק עם כרטיס RTX 4090 בודד?

לא. המשקלים תופסים 222 גיגה בייט בזיכרון, וכרטיס בודד מחזיק עד 24 גיגה בייט בלבד. תצטרכו שרת עם מספר כרטיסים מקצועיים או גרסאות מכווצות מאוד אם וכאשר הקהילה תוציא כאלה.

מה ההבדל בין 104 מיליארד הפרמטרים ל־6 מיליארד הפעילים בפועל?

המודל מחזיק ידע של מודל ענק אבל מנתב כל שאלה רק לרשתות הרלוונטיות. זה מאפשר ליהנות ממהירות עיבוד של מודל קטן בהרבה, כל עוד יש לכם מספיק זיכרון להחזיק את כל המשקלים באוויר.

איך מריצים

כדי להריץ אותו מקומית צריך מערך שרתים רציני. המשקלים שוקלים 222 גיגה בייט בפורמט bfloat16, כך שתצטרכו לפחות 250 עד 300 גיגה בייט של זיכרון וידאו ייעודי רק כדי לטעון אותו לפני שמתחילים להריץ משימות יצירת תמונה או וידאו. ההוראות הרשמיות מזכירות שימוש בשרתי H20 עם חבילות ייעודיות ל־CUDA 12.4.

מי שאין לו אשכול של כרטיסי שרת עם חיבור מהיר ביניהם פשוט לא יצליח להריץ את זה באופן סביר. אם אתם בונים שירות ולא מפתחים תשתית מחקר עצמאית, עדיף להמתין לממשקי API בענן או להשתמש בגרסאות קלות יותר כמו סדרת lite של הפרויקט.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("inclusionAI/Ming-flash-omni-2.0")
img = pipe("a photo").images[0]

הקבצים

98 קבצים במאגר, 222 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא MIT, שזה הרישיון הכי פתוח שיש. מותר לקחת את המשקלים, לשנות אותם, לשלב אותם במוצרים מסחריים סגורים ולהריץ אותם בלי לשלם תמלוגים. התנאי היחיד הוא לשמור על הצהרת זכויות היוצרים של המפתחים בתוך הקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗