GPT
V

VibeVoice-ASR-BitNet

קוד פתוח

microsoftmit2026-07-24

  • ggml
  • safetensors
  • gguf
  • vibevoice
  • ASR

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

התמלול הזה רץ מהר יותר מוויספר ישירות על המעבד, בלי כרטיס מסך. אם אתם בונים שירות שחייב לעבד אודיו מקומית בזמן אמת, זה בדיוק המקום להתחיל בו.

  • 323Mפרמטרים
  • 12.1 GBמשקל הקבצים
  • 13,329הורדות בחודש
  • 195לייקים

מה זה

מייקרוסופט לקחו את מודל התמלול שלהם וכיווצו אותו לנפח עבודה של 1.58 ג'יגה בייט באמצעות קוונטיזציה אגרסיבית של BitNet ו־ggml. המבנה מפוצל למקודד של 0.65 ג'יגה בייט ולמפענח שפה של 0.92 ג'יגה בייט. השילוב הזה נותן מהירות עבודה גבוהה פי 1.6 עד 2.3 ביחס ל־Whisper.cpp, כשהוא יורד מפקטור זמן אמת של 1 כבר בשלושה תהליכוני מעבד.

במבחני דיוק הוא עוקף את וויספר בחלק מהמשימות באנגלית, כמו מבחני AMI לשיחות מרובות משתתפים שבהם הוא רושם 21.36 אחוזי שגיאה מול 27.07 של וויספר. מצד שני, במבחנים קלאסיים ונקיים כמו LibriSpeech הוא מפגר אחריו ומגיע ל־2.41 אחוזים לעומת 1.98. הפשרות מורגשות בעיקר באודיו מורכב בסינית, שם הדחיסה פגעה בו ורשמה 27.45 אחוזי שגיאה לעומת 19.83 במודל המקורי.

מתאים ל

  • תמלול שיחות על מחשב נייד

    הוא מנצל מעט זיכרון ורץ על מעבד פשוט בלי צורך בחומרת שרת כבדה.

  • מכשירי IoT חכמים

    התאמה למעבדי ARM מאפשרת להריץ זיהוי פקודות קוליות מקומית לגמרי.

  • תמלול שיעורים באנגלית

    הדיוק שלו באנגלית טבעית עוקף את וויספר בחלק ניכר מבדיקות ההקלטה.

איפה זה נופל

הבעיה המרכזית לקורא המקומי היא היעדר מוחלט של עברית. המודל תומך באנגלית, סינית, צרפתית, איטלקית, קוריאנית, פורטוגזית ווייטנאמית בלבד, כך שלמוצר מקומי אין מה לחפש כאן. בנוסף, הקוונטיזציה הקיצונית יוצרת פער ניכר לעומת גרסת הבסיס בהקלטות מרובות דוברים, כפי שרואים במבחן AliMeeting שמזנק ל־40.58 אחוזי שגיאה.

שאלות
נפוצות

האם אפשר להשתמש בו לתמלול פגישות בעברית?

לא. רשימת השפות הנתמכות כוללת אנגלית, סינית, צרפתית, איטלקית, קוריאנית, פורטוגזית ווייטנאמית בלבד. אין לו תמיכה רשמית בעברית והוא ייכשל בניסיון כזה.

למה הקבצים שוקלים מעל 12 ג'יגה בייט אם המודל מוגדר כ־1.58?

המאגר כולל גם את קובצי ה־SafeTensors המקוריים ששוקלים כ־10.7 ג'יגה בייט ונועדו להמרות נוספות. בשביל להריץ אותו בפועל מורידים רק את שני קובצי ה־GGUF המכווצים, שביחד שוקלים בדיוק 1.58 ג'יגה בייט.

איך מריצים

אין שום צורך ב־GPU. המודל מיועד להרצה על מעבדי x86 עם תמיכת AVX2 או מעבדי ARM עם NEON באמצעות הקוד של VibeASR.cpp. כל מה שצריך כדי לתמלל בזמן אמת הוא מעבד מודרני מרובע ליבות, כיוון שבארבעה תהליכונים הוא כבר מגיע לזמן עיבוד של 0.63 משך האודיו.

אם המוצר שלכם מעבד שעות של הקלטות ברקע על שרת ענן חזק, אין סיבה להסתבך עם ההרצה הזו ועדיף לשלוח בקשה ל־API רגיל. המודל הזה משתלם רק אם אתם חייבים לחסוך עלויות שרתים יקרות או מחפשים לרוץ ישירות על חומרת קצה.

ollama run hf.co/microsoft/VibeVoice-ASR-BitNet:Q6_K

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצר סגור ולהפיץ אותו חופשי, כל עוד שומרים על הודעת זכויות היוצרים של מייקרוסופט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗