GPT
Q

Qwen2.5-Omni-7B

קוד פתוח

Qwenother2025-03-22

  • transformers
  • safetensors
  • qwen2_5_omni
  • multimodal
  • any-to-any

יש כאן גם סקירה על Qwen עצמו.

זה מודל שמקבל טקסט, תמונה, אודיו ווידאו, ומחזיר טקסט ודיבור בזמן אמת. הוא מיועד למי שרוצה שיחה קולית רציפה בלי שרשור של מודלים נפרדים.

  • 11Bפרמטרים
  • 20.8 GBמשקל הקבצים
  • 344,722הורדות בחודש
  • 1,936לייקים

מה זה

הארכיטקטורה כאן מחברת ראייה, שמיעה ודיבור תחת מודל יחיד במקום לחבר מנוע זיהוי קולי, מודל שפה ומנוע הקראה נפרדים. הוא משתמש במנגנון סנכרון זמנים בשם TMRoPE כדי לחבר בין תמונות וידאו לציר הזמן של האודיו. התוצאה היא תגובה ישירה בדיבור חי.

במדד OmniBench שבודק שילוב מולטימודלי הוא הגיע לציון ממוצע של 56.13%, מעל MiniCPM-o שקיבל 40.50% ו־Gemini-1.5-Pro שהגיע ל־42.91%. במבחני זיהוי דיבור כמו Common Voice 15 באנגלית הוא קיבל 7.6% שגיאות מילים לעומת 9.3% ב־Whisper-large-v3, מה שמראה שהבנת האודיו שלו חזקה. עם זאת, בטקסט נקי הוא מציג נסיגה מול מודלי טקסט ייעודיים. ב־MMLU-Pro הוא מקבל 47.0 לעומת 56.3 במודל Qwen2.5-7B הרגיל.

מתאים ל

  • עוזר קולי אינטראקטיבי

    מאפשר שיחה קולית שוטפת ללא עיכובים של חיבור מספר מנועים.

  • ניתוח וידאו ואודיו יחד

    מסנכרן זמנים בין רצועת הקול לפריימים של תמונה בזכות TMRoPE.

  • תמלול והבנת שיחות

    עוקף את Whisper במדדי שגיאות מילים בבדיקות דיבור מסוימות.

איפה זה נופל

המחיר של יכולות הקול והווידאו הוא ירידה ברורה ביכולות החשיבה הטקסטואליות. במבחני קוד כמו HumanEval הוא מקבל 78.7 לעומת 84.8 בגרסת הטקסט הרגילה. בנוסף, הכרטיס מדווח על תמיכה ישירה באנגלית בלבד. אם תנסו להריץ שיחות קוליות מורכבות בעברית, סביר מאוד שתיתקלו בקשיים בהבנה ובהגייה לא טבעית.

אותה משפחה

Qwen2.5-Omni יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל לשיחה קולית בעברית?

המודל מוגדר עם תמיכה בשפה האנגלית בלבד. הוא לא אומן במיוחד על עברית, ולכן בדיבור ובהבנה קולית התוצאות יהיו מוגבלות מאוד ולא מתאימות למוצר.

האם הוא מחליף מודל טקסט כמו Qwen2.5-7B?

לא. התוספת של מולטימטדליות וקול פגעה ביכולות הטקסטואליות והקוד שלו, ולכן למשימות טקסט טהורות עדיף להישאר עם מודל שפה רגיל.

איך מריצים

המודל כולל כ־11 מיליארד פרמטרים ומשקלו 20.8GB בפורמט bfloat16. כדי לטעון אותו עם הקשר ועיבוד מדיה בזמן אמת תצטרכו כרטיס מסך עם לפחות 32GB זיכרון כמו A100 או זוג כרטיסים מקומיים. שימוש בכרטיס ביתי פשוט של 16GB ייכשל ללא קוונטיזציה.

הוא מופעל דרך ספריית transformers הרגילה בפייתון. אם אתם זקוקים למענה זול בלי להחזיק שרת יקר שדולק תמיד ברקע, שירות ענן או API מנוהל יהיו עדיפים בהרבה על תחזוקת תשתית כבדה כזו.

from transformers import pipeline

pipe = pipeline("any-to-any", model="Qwen/Qwen2.5-Omni-7B")
print(pipe("שלום"))

הרישיון

הרישיון הרשמי מוגדר כ־other ללא פירוט תנאים בכרטיס המודל. המשמעות היא שאין היתר שימוש מסחרי ברור ואי אפשר להטמיע אותו במוצר מסחרי עד שבודקים את קובץ הרישיון המדויק במאגר כדי לוודא אם יש מגבלות שימוש או הפצה.

הרישיון המלא בעמוד המודל ↗