GPT
M

Ming-Lite-Omni-1.5

קוד פתוח

inclusionAImit2025-07-15

  • diffusers
  • onnx
  • safetensors
  • bailingmm
  • any-to-any

מודל מולטימודלי מלא שמקבל טקסט, תמונה, וידאו ושמע, ומסוגל גם לפלוט תמונה, קול וטקסט. הוא מתאים למי שרוצה pipeline אחד שעושה הבנה ויצירה בלי לחבר מודלים שונים.

  • 19Bפרמטרים
  • 53.8 GBמשקל הקבצים
  • 1,270הורדות בחודש
  • 84לייקים

מה זה

מדובר בארכיטקטורת תערובת מומחים עם 20.3 מיליארד פרמטרים כוללים, מתוכם 3 מיליארד פעילים בכל צעד, הבנויה על בסיס Ling-lite-1.5. הייחוד כאן הוא בטווח הקלט והפלט. הוא לא רק מנתח תמונות או מתמלל שמע, אלא כולל מפענח שמע ייעודי לסינתזה בזמן אמת, ומודול מבוסס diffusers ליצירת תמונות, עריכת תווי פנים ופילוח חזותי.

במבחני ביצועים הוא עומד ראש בראש מול מודלים כמו Qwen2.5-VL-7B ומוביל בהבנת וידאו עם 69.83 ב־VideoMME ו־59.54 ב־LongVideoBench בזכות קידוד מרחב-זמן תלת-ממדי. בתחום המסמכים הוא משיג 88.90 ב־OCRBench ו־88.84 ב־ChartQA, ומפגין יכולת חזקה מאוד בניתוח דיאגרמות. הוא גם מציג שליטה חריגה בדיאלקטים סיניים, לצד ביצועי שמע באנגלית.

מתאים ל

  • עריכת תמונות מונחית שיחה

    הוא יודע לשנות הבעות פנים תוך שמירה על זהות האדם והסביבה לפי הוראות טקסטואליות.

  • ניתוח מסמכים וגרפים מורכבים

    הוא משיג 88.84 ב־ChartQA ומצטיין בחילוץ מידע מדויק מתוך תרשימים וטבלאות.

  • פילוח חזותי והבנת מרחב בתמונה

    הוא מייצר מפות עומק, קווי מתאר ותיבות זיהוי ישירות מתוך הנחיות בשפה טבעית.

איפה זה נופל

המודל מוכוון בבירור לשוק הסיני. בבדיקות זיהוי דיבור הוא מצטיין במנדרינית ובמגוון ניבים מקומיים, אבל אין שום אזכור ליכולות בעברית או תמיכה בטקסט מימין לשמאל. אם אתם בונים שירות לשוק המקומי, סביר מאוד שתיתקלו בבעיות. בנוסף, בשיבוט קול הוא מפגר אחרי מודלים ייעודיים כמו CosyVoice 2 או Seed-TTS, עם שגיאות תמלול גבוהות יותר ודמיון קול נמוך יותר.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב ביתי עם כרטיס מסך רגיל?

לא. המודל דורש כמעט 54 גיגה-בייט של משקלים בזיכרון, בלי לחשב את שכבות ההרצה של יצירת התמונה והשמע. תצטרכו חומרת שרתים עם 48 גיגה-בייט זיכרון גרפי ומעלה כדי להפעיל אותו בצורה תקינה.

האם המודל מתאים לזיהוי דיבור או טקסט בעברית?

הנתונים הרשמיים בודקים רק אנגלית ומגוון רחב של ניבים סיניים. אין תיעוד או ערבויות לגבי עברית, וכנראה שתקבלו תוצאות חלשות מאוד בשמע ובקריאת מסמכים מקומיים.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־53.8 גיגה-בייט בפורמט bfloat16. כדי לטעון אותו, במיוחד יחד עם מודול יצירת התמונות, תצטרכו כרטיס שרת רציני עם לפחות 48 גיגה-בייט עד 80 גיגה-בייט של VRAM, כמו A100 או H20 שמוזכר בהגדרות ההתקנה של הפרויקט.

ההתקנה דורשת סביבה מוקפדת עם גלגלי פייתון ייעודיים לקול כמו matcha_tts, קוד מותאם אישית שדורש trust_remote_code=True, ושימוש ב־Flash Attention 2. אם כל מה שאתם צריכים זה רק OCR או תמלול רגיל, להרים תשתית מקומית כזו זה כאב ראש מיותר ועדיף לפנות ל־API חיצוני.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("inclusionAI/Ming-Lite-Omni-1.5")
img = pipe("a photo").images[0]

הקבצים

48 קבצים במאגר, 53.8 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מפורסם תחת רישיון MIT. זהו רישיון מתירני שמאפשר שימוש מסחרי מלא, שינוי קוד והפצה, כל עוד אתם משאירים את הצהרת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗