GPT
O

OmniVoice-GGUF

קוד פתוח

Serveurpersocc-by-nc-4.02026-04-27

  • gguf
  • tts
  • text-to-speech
  • voice-cloning
  • voice-design

הסבה בפורמט GGUF למודל דיבור רב לשוני מבוסס Qwen3. הוא מאפשר לייצר אודיו ולשכפל קולות מקומית דרך omnivoice.cpp בלי להחזיק כרטיס מסך מפלצתי.

  • 6.0 GBמשקל הקבצים
  • 139,101הורדות בחודש
  • 60לייקים

מה זה

מדובר בפורט C++ ומשקולות מכווצות למודל OmniVoice שמקורו בפיתוח של שיאומי וצוות k2-fsa. המערכת מייצרת אודיו במונו בקצב דגימה של 24 קילוהרץ ותומכת בסינתזה מאפס וגם בשכפול קולות. החלק המעניין כאן הוא השימוש בבסיס שפה קטן של Qwen3 עם 0.6 מיליארד פרמטרים לצד טוקנייזר ייעודי שמבוסס על HuBERT ודחיסת DAC.

המשקולות פוצלו לשני קבצים שרצים יחד, אחד עבור מודל השפה שממיר טקסט לטוקנים, והשני עבור מודל האודיו שממיר את הטוקנים לגלי קול. בגלל האופי הרגיש של רכיבי האודיו, חלק מהטנסורים כמו ספריות הקוד של ה־RVQ נשמרו ברמת דיוק מלאה של F32 בכל הגרסאות כדי לא לפגוע באיכות השמע.

מתאים ל

  • שכפול קול במחשב אישי

    הרצה מקומית מלאה של Voice Cloning מבוסס דגימה קצרה, בלי לשלוח הקלטות לשרת צד שלישי.

  • הקראת טקסט בשפות אירופיות

    יצירת קבצי אודיו באנגלית, צרפתית או ספרדית מתוך טקסט כתוב, ישירות דרך מעבד רגיל או כרטיס פשוט.

  • ניסויי מחקר ופיתוח קולי

    בדיקת יכולות סינתזה מבוססות GGML ושימוש במודל שפה קומפקטי ליצירת טוקני אודיו בסביבת בדיקות.

איפה זה נופל

עברית לא מופיעה ברשימת השפות המוגדרות של המודל, שמתמקדת באנגלית, צרפתית, גרמנית, ספרדית, איטלקית, פורטוגזית, סינית ויפנית. מי שמחפש הקראה של טקסט מקומי לא יקבל כאן מענה ישיר בלי התאמות מורכבות. בנוסף, קצב הדגימה מוגבל ל־24 קילוהרץ במונו בלבד, כך שלא תקבלו כאן סאונד באיכות אולפן מסחרית.

שאלות
נפוצות

האם המודל מסוגל לדבר בעברית?

השפות שנתמכות רשמית בכרטיס המודל הן אנגלית, צרפתית, גרמנית, ספרדית, איטלקית, פורטוגזית, סינית ויפנית. עברית לא מצוינת שם. אם תזינו טקסט בעברית המודל כנראה ייכשל, יג'ברש או ינסה לבטא את האותיות עם מבטא משובש.

למה יש שני קובצי GGUF שונים עבור כל גרסה?

הארכיטקטורה של הכלי מפרידה בין מודל השפה שמפרש את הטקסט לבין רכיב האודיו שממיר את הייצוגים לקול. כדי להריץ יצירת קול צריך להוריד גם את קובץ ה־base וגם את ה־tokenizer באותה רמת כיול, למשל שניהם ב־Q8_0, ולהטעין אותם יחד ב־omnivoice.cpp.

איך מריצים

ההרצה נעשית דרך omnivoice.cpp שנבנה מקומית, ותומכת בלינוקס או ווינדוס עם תאימות לכרטיסי אנבידיה דרך CUDA, למעבדי אפל דרך Metal, וגם ל־Vulkan ומעבדים רגילים. צריך להוריד שני קבצים תואמים מאותה גרסה, אחד לבסיס ואחד לטוקנייזר.

לרוב האנשים גרסת Q8_0 תהיה הבחירה ההגיונית, שבה שני הקבצים יחד שוקלים פחות מגיגהבייט אחד של זיכרון ורצים בקלות על חומרה צנועה. למי שממש מוגבל בזיכרון גרפי קיימת גרסת Q4_K_M שמסתפקת בכ־660 מגהבייט בסך הכול, כך שאין שום צורך לפנות לשרתים חיצוניים רק כדי לייצר סאונד מקומי.

ollama run hf.co/Serveurperso/OmniVoice-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המשקולות מוגבלות ברישיון CC-BY-NC 4.0 בגלל אילוצים של נתוני האימון המקוריים משיאומי. הרישיון הזה אוסר כל שימוש מסחרי מכל סוג. מותר לכם לחקור, לפתח לשימוש פנימי או לבנות פרויקט אישי, אבל אי אפשר לשלב את המודל במוצר שנמכר ללקוחות.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗