GPT
Q

Qwen2.5-Omni-3B

קוד פתוח

Qwenother2025-04-30

  • transformers
  • safetensors
  • qwen2_5_omni
  • multimodal
  • any-to-any

יש כאן גם סקירה על Qwen עצמו.

מודל רב־מודאלי מקצה לקצה שמקבל טקסט, תמונה, אודיו ווידאו ומחזיר דיבור וטקסט בסטרימינג. הוא נותן אינטראקציה קולית וחזותית רציפה בקנה מידה קטן יחסית.

  • 5.5Bפרמטרים
  • 11.2 GBמשקל הקבצים
  • 397,717הורדות בחודש
  • 351לייקים

מה זה

המודל מבוסס על ארכיטקטורת Thinker-Talker ומשתמש בשיטה שנקראת TMRoPE כדי לסנכרן בין ציר הזמן של הווידאו לציר הזמן של השמע. המטרה שלו היא לטפל בכל סוגי הקלט, מטקסט ותמונות בודדות ועד שיחות קוליות או ניתוח וידאו, ולהוציא תשובות קוליות בדיבור שוטף בלי להסתמך על מודל הקראה חיצוני נפרד.

במבחני מולטימדיה מעורבים כמו OmniBench הוא מגיע לציון ממוצע של 52.19%, תוצאה שעוקפת מודלים גדולים בהרבה כולל Gemini-1.5-Pro שנבדק מולו. בהבנת אודיו ב־MMAU הוא קיבל 63.30, שזה גבוה משמעותית מ־Qwen2-Audio. מצד שני, במשימות טקסט טהורות הוא רושם ירידה מול מודלי הטקסט הרגילים של הסדרה, עם 40.4 ב־MMLU-Pro לעומת 43.7 במודל ה־3B המקביל.

מתאים ל

  • סייען קולי מבוסס וידאו

    אינטראקציה קולית שוטפת מול מצלמה, עם סנכרון זמנים מובנה בין הקול לווידאו.

  • ניתוח קובצי שמע מורכבים

    זיהוי אירועי קול, סיווג רגשות ומענה קולי מהיר ללא שרשור כלי תמלול נפרדים.

  • מענה שאלות על מסמכים ותמונות

    דיוק של 93.3 במבחן DocVQA מאפשר לחלץ מידע מגרפים ומסמכים ולהקריא את התשובה.

איפה זה נופל

למרות השם 3B, בפועל יש לו 5.5 מיליארד פרמטרים, כך שהוא כבד יותר ממה שנשמע בהתחלה. מעבר לכך, התמיכה בשפות מוגדרת רשמית לאנגלית בלבד, כך שלא כדאי לבנות עליו לפרויקטים בעברית בלי בדיקה מוקדמת של יכולות הזיהוי וההפקה. ביצועי התמלול שלו באנגלית וצרפתית נופלים מול Whisper-large-v3, ובמשימות קוד ב־HumanEval הוא מקבל 70.7 לעומת 74.4 של מודל הטקסט הפשוט, כך שהתוספת של הראייה והקול פגעה בחשיבה הלוגית.

אותה משפחה

Qwen2.5-Omni יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל ירוץ בצורה חלקה על כרטיס מסך ביתי?

כרטיס עם 16 גיגה זיכרון יספיק לטעינת המודל עצמו, שתופס מעל 11 גיגה. עם זאת, עיבוד של וידאו חי והזרמת שמע מעמיסים על הזיכרון, ולכן כרטיסים חלשים יותר יתקשו לתת קצב תגובה סביר.

האם הוא מתאים לשימוש בעברית?

המפתחים הגדירו את המודל רשמית עבור אנגלית. הוא עשוי להבין מילים בודדות בעברית אם נחשף אליהן באימון, אבל אסור להסתמך עליו כמערכת זיהוי או הפקת דיבור בעברית ללא אימון נוסף.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך עם לפחות 16 גיגה זיכרון כדי לטעון את משקלי ה־bfloat16 שנפחם 11.2 גיגה ולהשאיר מקום לפענוח וידאו ושמע. המשקלים שמורים במבנה של טרנספורמרס, כך שאפשר לטעון אותו ישירות בקוד פייתון רגיל, אבל החישוב של קלט וידאו חי במקביל להפקת שמע בסטרימינג דורש כוח עיבוד גרפי רציף.

גרסת ה־3B מיועדת בעיקר למי שחייב השהיה נמוכה בעבודה מקומית או תקציב חומרה מוגבל. אם אתם לא מחזיקים שרת ייעודי עם מאיץ מתאים או צריכים שירות יציב לעשרות משתמשים במקביל, כדאי לשקול קריאה ל־API מנוהל במקום להסתבך עם ניהול תורים של קובצי וידאו כבדים.

from transformers import pipeline

pipe = pipeline("any-to-any", model="Qwen/Qwen2.5-Omni-3B")
print(pipe("שלום"))

הרישיון

הרישיון של המודל מוגדר כ־other בכרטיס המודל. המשמעות היא שלא מדובר ברישיון קוד פתוח סטנדרטי כמו אפאצ׳י או MIT, אלא בהסכם תנאים ספציפי של המפתחים. מי שרוצה להטמיע את המודל במוצר מסחרי חייב לבדוק את קובץ הרישיון המצורף למאגר כדי לוודא אם יש מגבלות על שימוש מסחרי, כמות משתמשים או הפצה מחדש.

הרישיון המלא בעמוד המודל ↗