GPT
M

Ming-flash-omni-Preview

קוד פתוח

inclusionAImit2025-10-14

  • diffusers
  • safetensors
  • bailingmm_moe_v2_lite
  • any-to-any
  • en

מודל מולטימודלי מלא שמקבל ומייצר טקסט, תמונה ואודיו. הוא מבוסס תצורת מומחים שחוסכת כוח חישוב בזמן ריצה ומתאים למי שצריך עיבוד קול ותמונה תחת קורת גג אחת.

  • 104Bפרמטרים
  • 224 GBמשקל הקבצים
  • 1,785הורדות בחודש
  • 70לייקים

מה זה

הארכיטקטורה כאן מחזיקה 104 מיליארד פרמטרים בסך הכל, אבל מפעילה רק 6 מיליארד פרמטרים לכל טוקן. המבנה הזה מאפשר לו לעבד קלט של תמונה, וידאו, טקסט וסאונד, ולהוציא תמונה, טקסט ודיבור בלי להחזיק מודל נפרד לכל מדיה.

הוא כולל מנגנון שמשלב חלוקת תמונה ומקטעים ישירות לתוך תהליך העריכה, מה ששומר על עקביות של דמויות וסצנות. במבחן GenEval הוא מציג ציון של 0.90 בשליטה מרחבית בעריכת תמונה. בנוסף, הוא כולל יכולות זיהוי דיבור עם הקשר, שכפול קול, וטיפול ב־15 ניבים שונים בסינית לצד אנגלית.

מתאים ל

  • עריכת תמונות מונחית מקטעים

    שומר על עקביות של אובייקטים ומספק שליטה מדויקת במיקום אלמנטים לפי ציון 0.90 ב־GenEval.

  • שיחה בזמן אמת על וידאו

    קולט וידאו ואודיו ומחזיר דיבור וטקסט ברשת יחידה בלי לפצל משימות למודלים שונים.

  • זיהוי דיבור מורכב בניבים

    מיועד לניתוח שמע מבוסס הקשר ותומך באופן מוצהר ב־15 ניבים סיניים שונים.

איפה זה נופל

המודל מוגדר רשמית כגרסת Preview, כלומר בדיקה מוקדמת לפני שחרור יציב, מה שמגדיל את הסיכוי להתנהגות לא צפויה בפרודקשן. התמיכה בשפות מתמקדת באנגלית ובסינית, ולפי התיעוד אין שום אינדיקציה ליכולות בעברית. בנוסף, חילוץ המידע המלא דורש קריאה במאמר חיצוני, שכן הכרטיס אינו מפרט תוצאות של מבחני שפה סטנדרטיים או תמיכה בפורמטים מורכבים.

שאלות
נפוצות

האם המודל ירוץ על כרטיס מסך בודד?

לא. המשקלים תופסים 224 גיגה-בייט בזיכרון, ולכן נדרשים כמה מאיצי 80 גיגה-בייט במקביל רק כדי לטעון אותו.

האם יש תמיכה בעבודה עם עברית?

הכרטיס מציין תמיכה באנגלית ומתמקד בניבים בסינית בלבד. אין תיעוד ליכולות קריאה, כתיבה או דיבור בעברית.

איך מריצים

כדי להריץ אותו מקומית צריך להוריד 224 גיגה-בייט של משקלים בפורמט bfloat16. גם אם בזמן ריצה פעילים רק 6 מיליארד פרמטרים, כל 104 המיליארד חייבים לשבת בזיכרון, מה שדורש שרת עם כמה מאיצי A100 או H100 של 80 גיגה-בייט לפחות.

אם אין לכם אשכול שרתים ייעודי ותשתית אחסון מהירה, ההורדה והטעינה של 92 קבצים יהיו איטיות ויקרות מדי. במקרה כזה, עבודה מול שירות ענן או API חיצוני מבוסס שרתים מנוהלים היא הברירה המעשית היחידה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("inclusionAI/Ming-flash-omni-Preview")
img = pipe("a photo").images[0]

הקבצים

92 קבצים במאגר, 224 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ ברישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר סגור, בתנאי ששומרים על הודעת זכויות היוצרים ונוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗