GPT
Q

Qwen2.5-Omni-7B-GGUF

קוד פתוח

unslothother2025-05-28

  • transformers
  • gguf
  • qwen2_5_omni
  • multimodal
  • unsloth

מודל מולטימודלי מקצה לקצה שמקבל טקסט, תמונה, אודיו ווידאו, ומחזיר טקסט ודיבור בזמן אמת. מתאים למי שבונה סוכן קולי או וידאו בלי לשרשר מודלים נפרדים.

  • 125 GBמשקל הקבצים
  • 20,666הורדות בחודש
  • 87לייקים

מה זה

הארכיטקטורה מבוססת על מבנה של Thinker ו־Talker, ומיועדת לעבד קלט משולב ולהגיב בדיבור זורם ללא צורך במערכת המרת דיבור לטקסט חיצונית ובמנוע דיבור נפרד. החיבור הזה מונע את השיהוי שמצטבר בשרשור רכיבים נפרדים, וכולל מנגנון הצמדת חותמות זמן לסינכרון בין תמונה לשמע.

במבחני ביצועים רב-ערוציים כמו OmniBench המודל מגיע לתוצאה ממוצעת של 56.13 אחוז, גבוה מתוצאות של מודלים גדולים בהרבה כמו Gemini 1.5 Pro שמגרד שם 42.91 אחוז. בעיבוד תמונה הוא שומר על רמה קרובה מאוד ל־Qwen2.5-VL-7B הייעודי, למשל 59.2 במבחן MMMU val, ובמשימות הבנת שמע הוא עוקף את Qwen2-Audio ברוב המדדים.

מתאים ל

  • סוכן קולי בזמן אמת

    קבלת שמע והחזרת דיבור באותו מודל ללא שרשור מנועי ביניים חיצוניים.

  • ניתוח שיחות וידאו

    קריאת וידאו ואודיו יחד עם סינכרון חותמות זמן מובנה לאיתור אירועים.

  • תמלול והבנת שמע

    ביצועי זיהוי דיבור גבוהים מול Whisper עם יכולת הסקת מסקנות מהתוכן.

איפה זה נופל

למרות השם של משפחת Qwen, במבחני טקסט טהור המודל הזה משלם מחיר כבד על המולטימודליות שלו. במבחן MMLU-Pro הוא משיג 47.0 נקודות בלבד, בעוד המודל הרגיל Qwen2.5-7B מגיע ל־56.3 נקודות באותו גודל בדיוק. בנוסף, המודל מוגדר רשמית עבור אנגלית בלבד, ואין נתונים על תמיכה או ביצועים בעברית. לפני שמכניסים אותו למוצר מקומי חובה לבדוק אם הוא מסוגל בכלל לפענח שמע בעברית בלי להמציא מילים.

אותה משפחה

Qwen2.5-Omni יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל לשיחה קולית בעברית?

כרטיס המודל מציין אנגלית בלבד ומציג בדיקות בסיסיות בסינית, צרפתית וגרמנית. אין שום תיעוד או מבחן על עברית, וברוב המקרים מודלי שמע כאלה מייצרים הברות שגויות או נכשלים לחלוטין בניסיון לדבר עברית.

למה להוריד את גרסת ה־Omni במקום את Qwen2.5 הרגיל?

אם הצורך שלכם הוא טקסט בלבד, המודל הרגיל חזק ממנו משמעותית בהסקה לוגית. הבחירה בגרסה הזו רלוונטית רק אם המערכת שלכם חייבת להאזין ישירות למיקרופון, לעבד תמונה או לדבר בחזרה בקול אנושי ללא שרשור כלים נפרדים.

איך מריצים

הריפו הנוכחי כולל 33 קבצים במשקל כולל של 125 גיגה-בייט, שכן הוא מחזיק מגוון כיולים וחלוקות שונות של Unsloth Dynamic 2.0 בפורמט GGUF. אתם לא מורידים את כל המשקל הזה אלא בוחרים קובץ כיול בודד שמתאים לגודל הזיכרון שלכם.

כדי להריץ גרסת כיול בינונית של 7 מיליארד פרמטרים תצטרכו כרטיס מסך עם לפחות 8 עד 12 גיגה-בייט של זיכרון וידאו עבור טקסט ושמע בסיסיים, אם כי ניתוח וידאו שוטף יצרוך זיכרון נוסף. אם אין ברשותכם חומרה ייעודית מקומית ואתם בונים מוצר שצריך לשרת משתמשי קצה במקביל, שווה לבדוק ממשקי ענן במקום להחזיק שרת יקר רצוף.

ollama run hf.co/unsloth/Qwen2.5-Omni-7B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון של המאגר מוגדר כ־other ללא פירוט של תנאי שימוש חופשיים או מסחריים בדף המודל. המשמעות היא שאין אישור מפורש לשלב אותו במוצר מסחרי, וכל עוד לא בודקים את תנאי הרישיון המקוריים של Qwen ושל Unsloth, אתם מסתכנים בהפרת זכויות יוצרים.

הרישיון המלא בעמוד המודל ↗