GPT
H

higgs_audio_v2

רץ בדפדפן

smolaרישיון לא דווח2025-07-21

  • gradio
  • mcp-server

הדגמה שמייצרת דיבור מקצועי מטקסט ומאפשרת לשכפל קולות בעזרת דגימת שמע. היא מיועדת למפתחים וליוצרים שרוצים לבדוק את יכולות המודל של Boson AI ישירות בדפדפן.

  • הורדות בחודש
  • 405לייקים

מה זה

אתם מזינים טקסט להקראה, בוחרים תבנית עבודה, ומקבלים קובץ שמע לצד פלט הטקסט של המודל. הממשק מאפשר לבחור קול מתוך רשימת דגימות מובנות, או להעלות הקלטה אישית כדי לשכפל את גוון הדיבור לפי קובץ ייחוס וטקסט תואם.

מאחורי הקלעים רץ higgs-audio-v2 בגרסת 3B של חברת Boson AI יחד עם טוקנייזר ייעודי, לצד שרשרת מודלים לעיבוד אודיו כמו Whisper Large v3 Turbo, HuBERT ו־WavLM. התבניות המוכנות כוללות הקראה לפי תיאור קול בהנחיית המערכת, שיחה בין כמה דוברים שונים, הקראה בסינית, ותמיכה ניסיונית בהוספת מוזיקת רקע.

מתאים ל

  • שכפול קול אישי

    מעלים קובץ שמע קצר וטקסט ייחוס, ומייצרים דיבור חדש שנשמע בדיוק כמו הדובר המקורי.

  • דיאלוג מרובה דוברים

    מגדירים תיאורי קול שונים בהנחיית המערכת ומפיקים שיחה המשלבת מספר דמויות בקובץ אחד.

  • דיבוב טקסט לסינית

    משתמשים בתבנית המובנית להקראת טקסטים בסינית בעזרת מודל הבסיס של המערכת.

איפה זה נופל

שילוב מוזיקת רקע מוגדר כניסיוני ודורש כמה ניסיונות חוזרים עד שמגיעים לתוצאה סבירה. שכפול קול תלוי באיכות קובץ הייחוס שתעלו, ובממשק אין שום כלי מובנה לעריכת אודיו או חיתוך רעשים. בנוסף, חומרת שיתוף כמו A10G עשויה להיתקל במגבלות זיכרון תחת טקסטים ארוכים במיוחד או בעומס משתמשים.

שאלות
נפוצות

האם השימוש בהדגמה עולה כסף?

לא, השימוש בדף פתוח לחלוטין ורץ על גבי תשתית Spaces ללא עלות. אין צורך בהזנת אמצעי תשלום כדי להפיק שמע.

כמה זמן לוקח לייצר קטע קול?

משך היצירה תלוי באורך הטקסט שהזנתם ובזמינות מעבד ה־A10G באותו רגע. בסיום הפעולה הממשק מציג את זמן הריצה המדויק בשניות.

האם הקבצים שאני מעלה נשמרים?

ההקלטות שאתם מעלים לצורך שכפול מעובדות בזיכרון המערכת בענן בזמן הריצה. מאחר שלא הוגדרו תנאי פרטיות או רישיון, עדיף לא להעלות הקלטות רגישות.

האם אפשר להריץ את המערכת הזו מקומית?

כן, קוד הממשק והמשקולות של higgs-audio-v2 זמינים להורדה ברשת. תצטרכו מחשב עם כרטיס מסך חזק כדי להריץ את שרשרת המודלים במלואה.

איך משתמשים

בוחרים תבנית, מקלידים טקסט, לוחצים על Generate Speech וממתינים. הריצה מתבצעת על מאיץ מסוג zero-a10g שמקצה משאבים לפי דרישה, כך שייתכן זמן המתנה קצר בהפעלה ראשונה. אין צורך בהרשמה מיוחדת כדי לבדוק את הכלי, והמערכת מקפיצה הודעה עם מספר השניות המדויק שלקח תהליך היצירה מיד בסיום.

הרישיון

הרישיון לא דווח במאגר. במצב כזה אין אישור מפורש לשימוש מסחרי בקבצים שנוצרים, ולא ברור מה מעמדם המשפטי של קטעי הקול הפרטיים שאתם מעלים לצורך שכפול.

הרישיון המלא ב־Hugging Face ↗