GPT
M

Ming-Lite-Omni

קוד פתוח

inclusionAImit2025-05-02

  • transformers
  • onnx
  • diffusers
  • safetensors
  • bailingmm

מודל מולטימודלי מלא שמקבל ופולט טקסט, אודיו ותמונה במקביל. הוא מפעיל 2.8 מיליארד פרמטרים בפועל ומכוון להתחרות ביכולות של GPT-4o בקוד פתוח.

  • 19Bפרמטרים
  • 93.8 GBמשקל הקבצים
  • 69הורדות בחודש
  • 200לייקים

מה זה

הארכיטקטורה כאן מבוססת תערובת מומחים (MoE) בשם Ling, עם 19 מיליארד פרמטרים בסך הכול אבל רק 2.8 מיליארד פעילים בכל רגע נתון. המודל בנוי לטפל בכל שילוב אפשרי: קורא ומייצר טקסט, מפענח שמע ומפיק דיבור, ומנתח תמונות ווידאו לצד יכולת מובנית לצייר ולערוך תמונות. המנגנון הפנימי כולל נתבים ייעודיים לכל סוג מדיה, במטרה למנוע התנגשויות בין משימות שונות באותה רשת.

במבחני ביצועים, ההבנה הוויזואלית שלו קרובה לזו של Qwen2.5-VL-7B למרות מספר פרמטרים מופעלים קטן בהרבה, ובמשימות שמע והבנת דיבור הוא עוקף מודלים כמו Kimi-Audio ו־Qwen2.5-Omni. ביצירת תמונות הוא מציג מדד FID של 4.85 וציון GenEval של 0.64, שגוברים לפי הנתונים על SDXL.

מתאים ל

  • עוזר שיחה קולי מקומי

    קליטה והפקה ישירה של דיבור ללא מנועי ביניים נפרדים לתמלול והקראה.

  • ניתוח מסמכים וממשקים

    פענוח תרשימים וטבלאות עם ציון 88.4 ב־OCRBench וזיהוי רכיבי מסך.

  • עריכת תמונות מונחית שמע

    יכולת מובנית לקבל פקודה קולית או טקסט ולבצע שינוי ישיר בתוך התמונה.

איפה זה נופל

למרות יתרון המהירות של מודל MoE, ההורדה הכבדה של כמעט 94 גיגה-בייט הופכת את ההקמה לסיוט תשתיתי. ייצור התמונה עדיין חלש מאוד בשמירה על מיקומים וצבעי אובייקטים, עם ציון 0.31 בלבד במיקום ו־0.29 בהתאמת צבעים במבחן GenEval. בנוסף, הסקריפטים נשענים על ספריות ייעודיות ללינוקס כמו קובץ wheel מוגדר מראש, ואין בנתונים שום מידע על תמיכה בשפות שאינן אנגלית או סינית.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס ביתי כמו RTX 4090?

לא בלי קוונטיזציה עמוקה שאינה זמינה בחבילה המקורית. הטעינה שלו ב־bfloat16 לוקחת כ־41 גיגה-בייט זיכרון גרפי, כך שכרטיס של 24GB ייחנק מיד.

איך ביצועי הראייה שלו בהשוואה למודלים פופולריים אחרים?

במבחן התמונות הוא מגיע לציון ממוצע של 71.4, שזהה כמעט לחלוטין ל־Qwen2.5-VL-7B שמחזיק ממוצע של 71.5, אך עושה זאת עם פחות פרמטרים פעילים.

איך מריצים

טעינה ב־bfloat16 דורשת סביב 40,890 מגה-בייט של זיכרון גרפי, מה שמחייב מאיץ ברמה של NVIDIA H800 עם 80GB, או פיצול על פני שני כרטיסי 48GB. המשקל הכולל של הקבצים מגיע ל־93.8 גיגה-בייט וההורדה מחולקת על פני 168 קבצים שונים.

ההרצה המקומית מצריכה תלויות מורכבות כולל קובץ גלגל ספציפי של מנוע קול עבור לינוקס, התקנת diffusers בגרסה 0.33.0 והרצת קוד מרוחק עם BailingMMNative. מי שאינו מחזיק שרת ייעודי או זקוק רק לחלק מהיכולות, יעדיף לרוב לשלוח קריאות לרשתות חיצוניות מוכנות במקום לתחזק שרת כזה.

from transformers import pipeline

pipe = pipeline("any-to-any", model="inclusionAI/Ming-Lite-Omni")
print(pipe("שלום"))

הקבצים

168 קבצים במאגר, 93.8 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל משוחרר ברישיון MIT, שמעניק חופש פעולה כמעט מוחלט. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצר סגור, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗