GPT
Q

Qwen3-Omni-30B-A3B-Thinking

קוד פתוח

Qwenother2025-09-15

  • transformers
  • safetensors
  • qwen3_omni_moe
  • text-to-audio
  • multimodal

יש כאן גם סקירה על Qwen עצמו.

מודל מולטימודלי עם שרשרת חשיבה שמקבל אודיו, וידאו ותמונה ומחזיר טקסט. מתאים למי שחייב עיבוד אותות וקול יחד עם יכולת הסקה לוגית מורכבת.

  • 32Bפרמטרים
  • 59.1 GBמשקל הקבצים
  • 401,359הורדות בחודש
  • 318לייקים

מה זה

הגרסה הזו מתמקדת בחלק החשיבה של המשפחה. בניגוד לגרסת ההוראות שמחזיקה רכיב דיבור ומייצרת קול בחזרה, הדגם הזה לוקח קלט מכל סוג, מפעיל שרשרת חשיבה מעמיקה, ועונה בטקסט בלבד. המבנה מבוסס על תערובת מומחים עם כמעט 32 מיליארד פרמטרים, כשרק חלק קטן מהם מופעל בכל צעד, מה ששומר על מהירות ביחס לגודל.

המפרסמים מדווחים על תוצאות שהגיעו למקום הראשון ב־32 מתוך 36 מבחני ביצועים של קוד פתוח בעיבוד וידאו ואודיו, ורמת דיוק בזיהוי דיבור שמתחרה ישירות במודלים מסחריים כמו ג'מיני 2.5 פרו. המשמעות בפועל היא יכולת לנתח קבצי שמע מורכבים עם רעשי רקע, לחלץ טקסט מתמונות קשות, ולפתור בעיות מתמטיות חזותיות בלי לאבד את ההקשר בין הערוצים השונים.

מתאים ל

  • פתרון בעיות מתמטיקה חזותיות

    משלב את רכיב ההסקה הלוגית כדי לנתח תרשימים, גרפים ונוסחאות מתוך תמונות ולייצר פתרון מנומק בטקסט.

  • ניתוח מודיעיני של וידאו ואודיו

    מעבד במקביל רצועות קול ותמונה מקבצי וידאו ארוכים ומפיק דוחות מפורטים על סמך התוכן המצטבר.

  • זיהוי וניתוח שמע מורכב

    מזהה דיבור, רעשי סביבה ואפקטים קוליים בשפות הנתמכות, ומספק הסבר טקסטואלי מלא על ההקשר של ההקלטה.

איפה זה נופל

החיסרון הברור ביותר של גרסת החשיבה הוא חוסר היכולת להוציא קול, הפלט מוגבל לטקסט בלבד. בנוסף, רשימת שפות הקלט הקולי מונה 19 שפות בלבד, ועברית אינה מופיעה בה, כך שעיבוד שמע מקומי כנראה ייכשל לחלוטין או יגמגם מאוד. התמיכה בספריות כמו vLLM עדיין נמצאת בשלבי פיתוח והרצה, מה שאומר שסביבת הפרודקשן שלכם תישען על התקנות מקוד מקור שעלולות להישבר בעדכונים שוטפים.

אותה משפחה

Qwen3-Omni יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה מסוגל להקריא לי תשובות בקול?

לא. גרסת ה־Thinking כוללת רק את רכיב החשיבה ופולטת טקסט בלבד, בניגוד לגרסת ה־Instruct שמכילה את רכיב הדיבור.

האם אפשר להריץ אותו על מחשב נייד או כרטיס RTX בודד?

לא באופן מעשי. משקל הקבצים לבדו נושק ל־60GB, וכדי להעלות את כל הפרמטרים נדרש ציוד שרתים עם כמה עשרות גיגה־בייט של VRAM.

האם הוא יבין פקודות קוליות בעברית?

לא מומלץ לבנות על זה. רשימת שפות השמע הנתמכות כוללת 19 שפות שרובן אירופאיות ואסיאתיות, ועברית אינה חלק מהן.

איך מריצים

כדי לטעון את המשקלים צריך לפנות כ־60 גיגה של קבצים מהדיסק, ובזיכרון וידאו תצטרכו לפחות שני כרטיסי A100 או H100 של 80GB כדי להריץ בבטחה בלי קריסות של זיכרון חסר, במיוחד בגלל חלונות ההקשר של שמע ווידאו שדורשים FlashAttention 2.

ההתקנה מסורבלת ומחייבת כרגע משיכה של גרסת הפיתוח של transformers ישירות מגיטהאב והתקנת ffmpeg לטיפול במדיה. אם אתם צריכים גם פלט קולי, המודל הזה לא מתאים ותצטרכו את גרסת ההוראות, ואם אין לכם שרת ייעודי כבד ומנוהל, תעדיפו לפנות לנקודת קצה מנוהלת בענן במקום להתעסק עם שרשרת התלויות הזו.

from transformers import pipeline

pipe = pipeline("any-to-any", model="Qwen/Qwen3-Omni-30B-A3B-Thinking")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ולא כקוד פתוח סטנדרטי דוגמת Apache או MIT. זה אומר שאסור להניח שיש כאן אישור לשימוש מסחרי חופשי, וחובה להיכנס לקובצי הרישיון הישירים של הפרויקט כדי לבדוק הגבלות הפצה, איסור שימוש במוצרים מתחרים, או דרישות דיווח על כמות משתמשים.

הרישיון המלא בעמוד המודל ↗