GPT
V

vui

קוד פתוח

fluxionsapache-2.02025-06-05

  • vui
  • text-to-speech
  • tts
  • speech-synthesis
  • voice-cloning

המודל מזרים דיבור קולי אינטראקטיבי באנגלית בקצב מהיר במיוחד. הוא משלב נשימות והיסוסים כדי להישמע כמו שיחה אמיתית ולא כמו הקראה מרובוט.

  • 2.2 GBמשקל הקבצים
  • 420הורדות בחודש
  • 154לייקים

מה זה

מדובר במודל טקסט לקול בגודל 300 מיליון פרמטרים, שבנוי מעל הקודק של Qwen3-TTS. הוא רץ כחלק משרת פייתון שלם שמנהל תמלול, מודל שפה ומענה קולי בקצה אחד. הרעיון המרכזי פה הוא זמני תגובה נמוכים במיוחד: על כרטיס RTX 4090 הוא מגיע לקצב יצירה של פי 9 מזמן אמת, כולל תמיכה בקטיעת דיבור ברגע שהמשתמש מתחיל לדבר.

האימון התמקד בשיחות טבעיות ולא בהקראת קריינות נקייה. המשמעות היא שהפלט מכיל צחוק, שאיפות אוויר והיסוסים מובנים, עם תמיכה בתגיות ייעודיות בטקסט. המערכת כוללת ממשק שמתחזה לפרוטוקול של OpenAI Realtime API, כך שאפשר לחבר אליה לקוחות קיימים בלי לשנות קוד.

מתאים ל

  • בוט קולי מקומי

    תחליף מקומי ל־OpenAI Realtime API שרץ על חומרה מקומית ללא עלויות ענן לפי דקת שיחה.

  • דיבוב דמויות במשחקים

    הפקת דיבור עם אנחה, צחוק ונשימות שמתאימים לדיאלוגים חיים יותר מקריינות רגילה.

  • תמלול ומענה מהודעות קוליות

    נקודת קצה יחידה שמקבלת אודיו, מעבדת ומחזירה תשובה קולית בבקשת שרת אחת.

איפה זה נופל

המודל אומן על אנגלית בלבד ולא יודע עברית. שיבוט קולות חדשים מהקלטה חיצונית עובד פחות טוב מארבעת הקולות הצרובים מראש, וסובל מסטיות באיכות ומנטייה לחקות את צורת הדיבור של הדמויות המקוריות. בנוסף, חובה להזין תמלול שתואם מילה במילה להקלטת המקור כדי לא לשבור את הסינתזה. מתחת ל־8 ספרי קוד איכות השמע קורסת לחלוטין.

שאלות
נפוצות

המודל עובד בעברית?

לא. המודל תומך באנגלית בלבד, וארבעת הקולות המובנים מגיעים במבטאים בריטיים ואיריים. ניסיון להזין טקסט בעברית לא יעבוד.

האם אפשר להריץ אותו בלי כרטיס מסך חזק?

אפשר להריץ על מעבדי אפל דרך MLX, או להוריד את כמות ספרי הקוד בהגדרות כדי להקל על הזיכרון הגרפי. לסטאק המלא על פיסי עדיין צריך כרטיס אנבידיה עם 8 עד 12 גיגה זיכרון לפחות.

איך איכות שיבוט הקול מאודיו שלי?

היא נמוכה משמעותית מארבעת הקולות שמגיעים מאומנים מראש. תצטרכו הקלטה נקייה של חצי דקה לפחות ותמלול מדויק, ועדיין יהיו זליגות של אינטונציה לקולות הבסיס.

איך מריצים

כדי להריץ את הסטאק המלא שכולל תמלול, מודל שפה וקול תצטרכו לינוקס עם כרטיס מסך של אנבידיה וסביב 12 גיגה זיכרון גרפי. אם מעבירים את מנוע התמלול למעבד דרך Moonshine, דרישת הזיכרון בכרטיס יורדת לכיוון 8 גיגה. יש גם תמיכה במחשבי אפל דרך MLX. פקודת התקנה אחת מורידה את המשקלים, מתקינה תלויות ומרימה ממשק ווב מקומי.

אם אתם צריכים רק את ייצור הקול מתוך קוד, המודל שוקל 2.2 גיגה ורץ בנפרד בסקריפט עצמאי. שווה להרים אותו לבד אם כבר יש לכם תשתית שרתים ואתם רוצים רק שכבת דיבור מקומית מהירה בלי לשלם לפי דקה לספקים חיצוניים.

pip install -U huggingface_hub
hf download fluxions/vui

הרישיון

הקוד והמשקלים של fluxions משוחררים תחת רישיון אפאצ'י 2.0 שמאפשר שימוש מסחרי, שינוי והפצה חופשית. החלקים שנלקחו מ־Qwen של עליבאבא, כולל המקודד ומקודד הדובר, כפופים לתנאי הרישיון הנפרדים שלהם במאגרים המקוריים, ויש לוודא עמידה בהם לפני שילוב במוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗