GPT
H

higgs-tts-2-3b-base

קוד פתוח

bosonaiother2025-07-01

  • transformers
  • safetensors
  • higgs_audio_v2
  • text-to-audio
  • text-to-speech

הפקת דיבור מבוססת Llama 3.2 עם דגש חריג על רגש, דיאלוגים מרובי דוברים ושכפול קול. הוא מתאים למי שרוצה הרצה עצמית של סאונד מורכב בלי לשלם לפי דקה לספק ענן.

  • 5.8Bפרמטרים
  • 2,048טוקנים בהקשר
  • 10.8 GBמשקל הקבצים
  • 452,436הורדות בחודש

מה זה

הבסיס כאן הוא מודל שפה של 3.6 מיליארד פרמטרים שחובר אליו מתאם שמע ייעודי בשם DualFFN עם עוד 2.2 מיליארד פרמטרים, מה שמביא את הסך הכול לכמעט 5.8 מיליארד. הוא אומן על עשרה מיליון שעות שמע וטקסט, ותומך באנגלית, סינית, גרמנית וקוריאנית. החידוש המרכזי מול מודלים רגילים באותו סדר גודל הוא היכולת לטפל בדיאלוג בין כמה קולות במקביל, כולל שכפול קולות מאודיו קיים באפס דוגמאות.

במדדי רגש ושאלות כמו EmergentTTS, הוא עוקף את gpt-4o-mini-tts עם 75.7% ו־55.7% אחוזי ניצחון. במבחן הסימולציה הקולית ב־Seed-TTS הוא מציג דמיון דובר של 67.7, שזה גבוה מ־ElevenLabs באותו מבחן. בפועל זה אומר שהשמע לא יוצא מתכתי או שטוח, אלא שומר על עליות וירידות אינטונציה טבעיות יחסית, ואפילו מסוגל להמהם מנגינה או לייצר מוזיקת רקע קלה לצד הדיבור.

מתאים ל

  • הפקת דיאלוגים מרובי דוברים

    הוא יודע להחליף בין שתי דמויות שונות לפי תגיות טקסט בלי לערבב ביניהן.

  • שכפול קול מקומי באפס דוגמאות

    הוא קולט קול מדגימת שמע קצרה בהיסטוריה ומפיק ממנו משפטים חדשים ברמת דמיון גבוהה.

  • דיבוב משחקים עם משחק קולי

    התוצאות במבחני הרגש מראות גמישות אינטונציה טובה יותר מהקראה עסקית רגילה.

איפה זה נופל

הבעיה הבולטת ביותר היא שאין שום תמיכה בעברית, כך שהוא מוגבל כרגע לארבע השפות המוצהרות בלבד. בנוסף, חלון ההקשר מוגבל ל־2,048 טוקנים, מה שחונק לחלוטין הפקה של קטעים ארוכים כמו פרקי פודקאסט מלאים בלי לפצל ולתפור את האודיו ידנית. בשיחות בין שני דוברים נמדד שיעור שגיאות מילים של 18.88%, מה שאומר שבאחת מכל חמש מילים בערך תהיה תקלת הגייה או שיבוש בטקסט, וזה דורש בדיקה אנושית לפני שמעלים קובץ לאוויר.

שאלות
נפוצות

האם אפשר לייצר איתו דיבור בעברית?

לא. המודל אומן ותומך רשמית באנגלית, סינית, גרמנית וקוריאנית בלבד. ניסיון להזין טקסט בעברית ייכשל או ייצור הברות חסרות משמעות.

האם כרטיס מסך ביתי מספיק כדי להריץ אותו?

כרטיס עם 8 או 12 גיגה בייט זיכרון ייחנק ולא יספיק לטעינת הקבצים. תצטרכו כרטיס של 16 גיגה בייט לפחות, ועדיף 24 גיגה בייט כדי לייצר משפטים בלי קריסות זיכרון.

איך מריצים

המשקל הכולל של הקבצים עומד על 10.8 גיגה בייט, והוא נתמך ישירות בספריית transformers מגרסה 5.3 ומעלה. כדי להריץ אינפרנס בצורה סבירה צריך כרטיס מסך עם לפחות 16 גיגה בייט זיכרון גרפי, ועדיף 24 גיגה בייט כמו RTX 3090 או 4090 כדי להכיל גם את ה־KV cache והטוקנייזר הפנימי. המודל חוסך בערך 1.5 גיגה בייט זיכרון בזמן ריצה כיוון שהוא לא טוען את ראש השפה הטקסטואלי.

אם יש לכם שרת מקומי עם חומרה מתאימה, ההרצה משתלמת ברגע שמתחילים לעבד כמויות גדולות של דיאלוגים. אם אתם צריכים רק כמה שניות של הקראה בודדת ביום, התחזוקה וההמתנה לטעינה של 11 גיגה בייט לזיכרון הופכות את הסיפור למיותר מול שירותי ענן מוכנים.

from transformers import pipeline

pipe = pipeline("text-to-speech", model="bosonai/higgs-tts-2-3b-base")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ולא כרישיון קוד פתוח סטנדרטי כמו MIT או אפאצ'י. במצב כזה חובה לקרוא את קובץ הרישיון המצורף במאגר לפני כל שילוב בקוד מסחרי, כי ייתכנו הגבלות שימוש, איסור על הפצה מוצרית או תנאים שמחייבים פנייה ישירה לחברה.

הרישיון המלא בעמוד המודל ↗