GPT
Q

Qwen3-Omni-30B-A3B-Instruct

קוד פתוח

Qwenother2025-09-20

  • transformers
  • safetensors
  • qwen3_omni_moe
  • text-to-audio
  • multimodal

יש כאן גם סקירה על Qwen עצמו.

מודל רב־מודאלי מקצה לקצה שמקבל טקסט, תמונה, וידאו ושמע, ומחזיר תגובות קוליות וטקסטואליות בזמן אמת. הבחירה בו מתאימה למי שבונה סוכן קולי עצמאי בלי לשרשר מודלים נפרדים לדיבור ולטקסט.

  • 35Bפרמטרים
  • 65.7 GBמשקל הקבצים
  • 845,592הורדות בחודש
  • 997לייקים

מה זה

המודל מבוסס על ארכיטקטורת MoE בת 35 מיליארד פרמטרים ומחולק לשני רכיבים מרכזיים: Thinker לעיבוד והסקת מסקנות, ו־Talker שמייצר את פלט הדיבור ישירות. הוא תומך בכל שילוב של קלט ופלט בין טקסט, קול ווידאו, ומציע שלושה קולות שונים באנגלית. מעבר לשיחה רגילה, הוא יודע להתמודד עם שאלות על סרטונים, תמלול, ניתוח מוזיקה ותרגום משמע לשמע.

בבדיקות הביצועים של היוצרים, הוא הגיע לתוצאות מובילות ב־22 מתוך 36 מבחני שמע ווידאו כלליים, וב־32 מתוך 36 מול מודלים פתוחים אחרים. מבחינת זיהוי דיבור, הבנת שמע ושיחה קולית, הכרטיס מציג ביצועים שמשתווים לג'מיני 2.5 פרו, מה שאומר שאפשר לקבל יכולת שיחה טבעית ברמה של מודל ענן סגור.

מתאים ל

  • סוכן שירות קולי באנגלית

    מאפשר שיחה קולית רציפה וטבעית בזמן אמת עם השהיה נמוכה, בלי צורך לחבר מודל STT ומודל TTS נפרדים.

  • תחקור וניתוח של קובצי וידאו

    מנתח בו־זמנית את התמונה ואת ציר הקול של סרטונים, ומזהה אירועים שדורשים סנכרון בין מה שרואים למה ששומעים.

  • הפעלת פונקציות באמצעות קול

    מבצע קריאות לפונקציות ופקודות ישירות מתוך דיבור של משתמש, לצורך בניית סוכנים חכמים שנשלטים קולית.

איפה זה נופל

פלט הקול מוגבל לעשר שפות בלבד, ועברית אינה אחת מהן. גם ברשימת 19 שפות הקלט הקוליות עברית נעדרת לחלוטין, מה שפוסל אותו כרגע מעבודה קולית מקומית בארץ אלא אם מדובר באנגלית. תמיכה בהרצה דרך vLLM עדיין נמצאת בשלבי פיתוח מוקדמים, ותמיכה בפלט שמע שם עדיין לא שוחררה רשמית, מה שמקשה על פריסה יעילה ומהירה בייצור.

אותה משפחה

Qwen3-Omni יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מסוגל לנהל שיחה קולית בעברית?

לא. רשימת שפות הקלט הקוליות כוללת 19 שפות ופלט הקול תומך בעשר שפות בלבד, ועברית לא מופיעה באף אחת מהן. המודל מצהיר על תמיכה ב־119 שפות טקסט, אבל לקול בעברית הוא לא מתאים כרגע.

כמה זיכרון GPU דרוש כדי להרים אותו?

המודל שוקל מעל 65GB, ולכן תצטרכו לפחות 80GB של זיכרון וידאו להרצה בסיסית. אם תבטלו את רכיב הדיבור באמצעות פקודה ייעודית, תחסכו כ־10GB ותוכלו להריץ אותו על חומרה מעט יותר צפופה.

איך מריצים

משקל הקבצים עומד על 65.7 גיגה־בייט, כך שתצטרכו שרת עם כרטיסי GPU חזקים שתומכים ב־FlashAttention 2, כמו A100 או H100 עם לפחות 80GB זיכרון וידאו. אם אתם מוותרים על יצירת קול ומפעילים רק פלט טקסטואלי בעזרת הפקודה לכיבוי רכיב ה־Talker, תוכלו לחסוך כ־10GB מזיכרון הכרטיס ולהאיץ את הזמנים. הקוד דורש התקנה ישירה מהגיטהאב של transformers ומחבילת עזר ייעודית, לצד התקנת ffmpeg במערכת.

אם המוצר שלכם צריך רק שיחות טקסט או שאין לכם חומרה ייעודית לתחזק, שווה לקרוא ל־API חיצוני. הרצה עצמית של מפלצת כזאת בייצור שווה את המאמץ רק כשיש דרישה קשיחה לפרטיות מוחלטת או כשרוצים שליטה מלאה בהשהיות השמע.

from transformers import pipeline

pipe = pipeline("any-to-any", model="Qwen/Qwen3-Omni-30B-A3B-Instruct")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ולא כרישיון קוד פתוח סטנדרטי כמו Apache או MIT. זה אומר שאתם חייבים לבדוק לעומק את תנאי השימוש בקובץ הרישיון המקורי לפני שילוב שלו במוצר מסחרי, ולא להניח שמותר להשתמש בו בחופשיות.

הרישיון המלא בעמוד המודל ↗