GPT
V

VibeVoice-Large-Q8

קוד פתוח

FabioSarracinomit2025-10-01

  • transformers
  • safetensors
  • vibevoice
  • text-to-speech
  • audio

גרסה מכווצת של מודל הדיבור VibeVoice שחוסכת כמעט ארבעים אחוז זיכרון בלי להרוס את האודיו. היא נותנת איכות של מודל מלא על כרטיסי מסך ביתיים סבירים.

  • 9.3Bפרמטרים
  • 32,768טוקנים בהקשר
  • 10.8 GBמשקל הקבצים
  • 1,229הורדות בחודש

מה זה

מדובר במודל טקסט לקול בגודל 9.3 מיליארד פרמטרים שמבוסס על הארכיטקטורה של מיקרוסופט. הבעיה בדרך כלל עם כיבוץ של מודלים כאלה היא שדחיסה רגילה ל־8 ביט דופקת את רכיבי הסאונד והופכת את הפלט לרעש לבן. היוצר פתר את זה בעזרת כיבוץ סלקטיבי: 52 אחוז מהפרמטרים בחלק של מודל השפה נדחסו, בעוד שארבעים ושמונה האחוזים הקריטיים של האודיו, כמו הדיפיוז'ן וה־VAE, נשארו בדיוק מלא.

התוצאה בפועל היא ירידה מ־18.7 גיגה־בייט ל־11.6 גיגה־בייט, עם צריכת זיכרון גרפי של בערך 12 גיגה במקום 20. לפי כרטיס המודל, בדיקות השמיעה מראות איכות זהה לחלוטין למקור המלא, כך שמקבלים סאונד נקי בלי לשלם על כרטיס שרת יקר.

מתאים ל

  • הפקת דיבור במחשב ביתי

    מאפשר יצירת קולות איכותיים ישירות מכרטיס מסך של 12 גיגה בלי לקנות חומרה יקרה.

  • עבודה מקומית ב־ComfyUI

    משתלב ישירות בתוך פייפליין קיים באמצעות תוסף ייעודי ליצירת סאונד מאובטחת.

  • הסקה בשרתי ענן זולים

    צריכת הזיכרון הנמוכה חוסכת עלויות ומאפשרת לשכור שרתים פשוטים במקום מפלצות יקרות.

איפה זה נופל

המודל מוגדר ומיועד להסקה בלבד, כך שאי אפשר להשתמש בו לאימון נוסף או לפיין טיונינג. בנוסף, הוא כבול לחלוטין לאקוסיסטם של אנבידיה ו־CUDA, מה שמונע כל הרצה על מק, מעבדים רגילים או כרטיסי מסך מתחרים. טעינת המשקלים דורשת הרצת קוד מרוחק חיצוני שלא עבר ביקורת מלאה, מה שמחייב זהירות בסביבות סגורות.

למרות שהמודל מסומן כתומך בריבוי שפות, החומר אינו מספק פירוט או מבחנים לאיכות ההגייה בשפות ספציפיות כמו עברית, כך שחובה לבדוק את איכות הפלט באופן מעשי לפני שמשלבים אותו במערכת אמיתית.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב מק עם מעבד M2 או M3?

לא. המודל תלוי בספריית bitsandbytes ובסביבת CUDA, ולכן כרטיסי אנבידיה הם דרישת חובה מוחלטת. אין תמיכה במעבדי אפל סיליקון או בהאצת MPS.

האם יש הבדל באיכות הקול בהשוואה למודל המקורי?

היוצר ביצע כיבוץ סלקטיבי בלבד, כך שכל רכיבי האודיו הרגישים נשארו בדיוק מלא. לפי הנתונים שלו, איכות הצליל זהה למקור ואינה כוללת עיוותים או רעשי רקע.

איך מריצים

בשביל להריץ אותו מקומית חייבים כרטיס של אנבידיה עם תמיכה ב־CUDA ולפחות 12 גיגה־בייט VRAM, כמו RTX 3060 או 4070 Ti, יחד עם 16 גיגה זיכרון מערכת. המערכת דורשת ספריות transformers מגרסה 4.51.3 ומעלה ו־bitsandbytes מגרסה 0.43.0 ומעלה, ואינה עובדת בכלל על מעבדים, מחשבי מק עם אפל סיליקון או כרטיסי מסך של AMD.

ההרצה מתבצעת ישירות בפייתון דרך transformers עם trust_remote_code מופעל, או באמצעות תוסף ייעודי לממשק ComfyUI. למי שאין לו כרטיס אנבידיה מתאים בבית או בשרת, אין טעם לנסות להתקין מקומית, אלא עדיף לפנות לפתרונות ענן או שירותי צד שלישי.

from transformers import pipeline

pipe = pipeline("text-to-audio", model="FabioSarracino/VibeVoice-Large-Q8")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון MIT. זהו רישיון מתירני שמאפשר שימוש מסחרי מלא, שינוי, הפצה ושילוב במוצרים סגורים, בלי תשלום תמלוגים. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים והפטור מאחריות של היוצר בתוך הקוד או התיעוד של המוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗