GPT
S

s2-pro-gguf

קוד פתוח

rodrigomtother2026-03-17

  • gguf
  • text-to-speech
  • audio
  • fish-speech
  • tts

גרסת GGUF מכווצת למודל הדיבור Fish Audio S2 Pro שמאפשרת הרצה מקומית ושיבוט קול בלי פייתון. הפתרון מתאים למי שרוצה סינתזת קול מהירה בחיבור ישיר ל־C++.

  • 31.0 GBמשקל הקבצים
  • 12,159הורדות בחודש
  • 71לייקים

מה זה

הפרויקט הזה אורז את המודל Fish Audio S2 Pro, שמבוסס על שילוב של שני מודלי טרנספורמר בהיקף של כ־4.56 מיליארד פרמטרים יחד עם מקודד שמע פנימי, לקובץ GGUF יחיד. החלק המרכזי בנוי על ארכיטקטורת Qwen3 עם שלושים ושש שכבות, ולצידו רץ מודל מהיר שמייצר טוקנים אקוסטיים לעשרה ספרי קוד במקביל.

ההבדל המשמעותי כאן הוא מנוע ההרצה s2.cpp. במקום להסתבך עם סביבות פייתון כבדות, תלויות של PyTorch ודרייברים מסובכים, מקבלים קוד C++ טהור שרץ מעל GGML ותומך בהאצת חומרה דרך Vulkan. המודל מוגדר כרב־לשוני ויודע לבצע שיבוט קול מדגימה נקייה של חמש עד שלושים שניות יחד עם תמלול תואם.

מתאים ל

  • שיבוט קול עצמאי ללא פייתון

    הרצה מקומית של שיבוט קול בעזרת קובץ C++ יחיד, דגימת שמע קצרה ותמלול, בלי תלות בחבילות צד שלישי.

  • סינתזת דיבור במערכות משובצות

    הפקת שמע מקומית על כרטיסי מסך צנועים עם תמיכת Vulkan, החל מ־4GB זיכרון גרפי בקוונטיזציה של q4 או q5.

  • מחקר ופיתוח מנועי קול

    בדיקת ביצועים של ארכיטקטורת Dual-AR והתאמת קוד מקור ב־C++ למנועי עיבוד שמע מותאמים אישית.

איפה זה נופל

המפתח מבהיר כבר בהתחלה שמנוע ההרצה נמצא בשלב אלפא ניסיוני ואינו מוכן לפרודקשן. מדובר בפרויקט קהילתי מוקדם עם שינויים שוברים וחוסר יציבות שצריך לקחת בחשבון. בנוסף, הרצה על מעבד בלבד אטית מאוד, ודחיסה לגרסאות של פחות משלושה גיגה־בייט פוגעת ישירות באיכות הקול המופק. שיבוט הקול מחייב הקלטה נקייה מאוד באורך מדויק בליווי תמלול, כך שהוא לא יסלח על רעשי רקע.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך של AMD?

כן, המנוע נבנה עם תמיכה ב־Vulkan ולא מסתמך על CUDA בלבד. הוא עובד על מעבדים גרפיים של AMD, אנבידיה ואינטל כאחד, כל עוד מקמפלים עם הדגל המתאים.

איזו גרסת קוונטיזציה הכי מומלצת להתקנה?

אם יש לכם בין שישה לשמונה גיגה־בייט זיכרון גרפי, גרסת q6_k נותנת איזון מצוין בין דיוק לצריכת משאבים. מתחת לארבעה גיגה אפשר לבחור ב־q4_k_m, אך מתחת לזה יש ירידה מורגשת באיכות.

איך מריצים

כדי להריץ אותו צריך לקמפל את s2.cpp בעזרת CMake ומהדר C++17, ולהוריד את קובץ המודל יחד עם קובץ ה־tokenizer.json. בצד החומרה יש תמיכה במאיצים של אנבידיה, אינטל ו־AMD דרך Vulkan, או עבודה על המעבד בלבד עם מספיק זיכרון ראם, אם כי הריצה על מעבד איטית משמעותית.

דרישות הזיכרון הגרפי נעות בין שמונה גיגה־בייט ומעלה לגרסת q8_0, דרך ארבעה עד שישה גיגה לגרסת q5_k_m, ועד פחות משלושה גיגה לקבצי q3_k או q2_k. אם אין לכם לפחות ארבעה גיגה־בייט פנויים בזיכרון הגרפי, פגיעת האיכות בגרסאות הנמוכות מורגשת, ובמצב כזה עדיף לפנות ל־API חיצוני במקום להריץ מקומית.

ollama run hf.co/rodrigomt/s2-pro-gguf:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המשקלים מופצים תחת רישיון המחקר של Fish Audio. השימוש חופשי למחקר ולמטרות לא מסחריות בלבד, עם חובת מתן קרדיט. שימוש מסחרי מכל סוג דורש רכישת רישיון נפרד בכתב ישירות מהחברה, ולכן אסור לשלב אותו כרגע במוצר מסחרי ללא הסכם מולם.

הרישיון המלא בעמוד המודל ↗