GPT
Q

Qwen2.5-Omni-3B-GGUF

קוד פתוח

unslothother2025-05-28

  • transformers
  • gguf
  • qwen2_5_omni
  • multimodal
  • unsloth

מודל מולטימודלי של 3 מיליארד פרמטרים שמקבל טקסט, תמונה, קול ווידאו ומחזיר דיבור וטקסט בזמן אמת. הוא מיועד למי שצריך תגובה קולית מיידית מקומית בלי לשרשר מנועים נפרדים.

  • 61.7 GBמשקל הקבצים
  • 7,434הורדות בחודש
  • 53לייקים

מה זה

הארכיטקטורה כאן מחברת יכולת קליטה של וידאו ואודיו עם יצירת דיבור חי, במבנה של Thinker ו־Talker. במקום לחבר מודל תמלול, מודל שפה ומנוע הקראה, הכל נעשה במעבר אחד שמסנכרן בין ציר הזמן של התמונה לקול באמצעות מנגנון בשם TMRoPE.

במבחן OmniBench שבודק שילוב של קול, מוזיקה ואירועי שמע, הוא השיג ציון של 52.19, תוצאה שעוקפת מודלים גדולים בהרבה כמו Gemini 1.5 Pro שנמדד שם על 42.91. בהבנת מסמכים ותמונות ב־DocVQA הוא מגיע ל־93.3, קרוב מאוד לגרסת ה־7B, כך שהדחיסה לנפח קטן לא פגעה ביכולת הראייה הבסיסית שלו.

מתאים ל

  • עוזר קולי מקומי רב-ערוצי

    קבלת קלט מצלמה ומיקרופון ומענה קולי מהיר ישירות מהחומרה המקומית.

  • ניתוח מסמכים וטבלאות

    חילוץ נתונים מדויק מתמונות עם ציון של 93.3 במבחן DocVQA.

  • זיהוי וסיווג צלילים

    הבנת מוזיקה ואירועי שמע בזכות ציון ממוצע של 63.3 בבנצ'מרק MMAU.

איפה זה נופל

החולשה הבולטת היא בדיוק התמלול וביכולות ההיגיון הטקסטואלי הטהור. ב־MMLU-Pro הוא מקבל ציון של 40.4 בלבד, נמוך יותר מגרסת הטקסט הרגילה של Qwen2.5-3B שעומדת על 43.7. בנוסף, בספריית Librispeech באנגלית הוא קיבל שיעור שגיאות של 4.5 במבחן הקשה, שזה פחות טוב מ־Whisper large v3 שמגיע ל־3.6, והוא אינו מוגדר לתמיכה בעברית.

אותה משפחה

Qwen2.5-Omni יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעבודה בעברית?

המודל מוגדר רשמית עבור אנגלית בלבד. הכרטיס אינו מציין תמיכה בעברית, ולכן הוא לא מתאים לעיבוד קולי או טקסטואלי בשפה זו ללא אימון נוסף.

למה המאגר שוקל 61.7 גיגה בייט אם המודל הוא רק 3B?

המשקל הכולל נובע מכך ש־Unsloth העלו 33 קבצים המכילים מגוון גרסאות קוונטיזציה ומשקלים שונים. בפועל מורידים רק קובץ בודד שמתאים לגודל הזיכרון שלכם.

איך מריצים

המאגר כולל 33 קבצים בנפח כולל של 61.7 גיגה בייט, שמכילים את המשקלים והקוונטיזציות השונות ש־Unsloth הכינו. בשביל להריץ גרסה מכווצת של מודל כזה תצטרכו כרטיס מסך עם לפחות 8 עד 12 גיגה זיכרון כדי להחזיק את העיבוד הקולי והוויזואלי במקביל.

אם אתם לא צריכים עיבוד מקומי מסיבות של פרטיות או ניתוק מהרשת, שירות ענן יחסוך את כאב הראש של ניהול זיכרון המולטימדיה. הריצה המקומית הגיונית בעיקר כשחייבים תגובה מיידית בחומרה שלכם.

ollama run hf.co/unsloth/Qwen2.5-Omni-3B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון מוגדר כ־other ולא כקוד פתוח סטנדרטי. זה אומר שחובה לבדוק את תנאי הרישיון המקוריים של עליבאבא ו־Unsloth לפני שילוב שלו במוצר מסחרי, כי ייתכנו הגבלות על שימוש מסחרי או חובת חשיפת קוד.

הרישיון המלא בעמוד המודל ↗