GPT
A

audio.cpp-gguf

קוד פתוח

audio-cppother2026-07-14

  • audio.cpp
  • gguf
  • quantized
  • text-to-speech
  • automatic-speech-recognition

זהו אוסף המרות GGUF לריצת קול מקומית בספריית audio.cpp. הוא מיועד למי שרוצה להריץ מודלי דיבור וסאונד שונים תחת תשתית C++ יעילה אחת ללא פייתון כבד.

  • 588 GBמשקל הקבצים
  • 2,313,604הורדות בחודש
  • 111לייקים

מה זה

במקום מודל בודד, המאגר מאגד המרות GGUF לעשרות מודלים שונים בתחומי הקול, כולל טקסט לדיבור, זיהוי דיבור, הפרדת ערוצים, שיבוט קול ויצירת אפקטים. המערך כולל שמות מוכרים כמו משפחת Qwen3 לדיבור ותמלול, מודלים של Stable Audio, כלי תמלול כמו Parakeet, ומודלי הפרדה כמו HTDemucs ו־RoFormer. הגדלים נעים בין מודלים זעירים של 100 מיליון פרמטרים ועד דגמים כבדים של 4 מיליארד פרמטרים.

הייחוד כאן הוא ההתאמה הישירה לספריית audio.cpp, שמאפשרת טעינה מבוססת קבצי GGUF בדומה למה שמוכר מעולם שפות ה־LLM. הקבצים מחולקים לרמות דיוק שונות לפי מודל, החל מ־F32 ו־BF16 ועד כימותים אגרסיביים יותר כמו Q8 או Q4_K. התוצאה היא מעטפת עבודה אחידה שמחליפה ערימות של ספריות שונות בריצה מקומית קלת משקל.

מתאים ל

  • הקראת טקסט מקומית ללא ענן

    מודלים כמו משפחת Qwen3-TTS או MOSS מאפשרים להפיק קול על הברזל המקומי בלי להוציא מידע לרשת.

  • תמלול אודיו מהיר בכרטיס מקומי

    שימוש ב־Qwen3-ASR או Parakeet תחת audio.cpp נותן תמלול בדיוקים שונים עם צריכת זיכרון מופחתת.

  • הפרדת ערוצי מוזיקה ודיבור

    גרסאות GGUF של RoFormer ו־HTDemucs מאפשרות לבצע בידוד ווקאל וכלים בתוך שרשרת עיבוד קול יעילה.

איפה זה נופל

המאגר הזה לא אחיד באיכות שלו. המפתחים עצמם מזהירים שמדדי כימות אוטומטיים לא משקפים במדויק את איכות השמע, וכימותים נמוכים עלולים להישמע רע לאוזן אנושית. מעבר לכך, כל מודל מגיע מפרויקט מקור אחר, כך שיכולות השפה משתנות לגמרי מדגם לדגם, ורובן המוחלט לא מאומן או מכויל לעברית תקינה. חובה לבדוק כל קובץ, שפת יעד וכימות באופן נקודתי לפני שמשלבים אותם בקוד אמיתי.

שאלות
נפוצות

חייבים להוריד את כל ה־588 גיגהבייט כדי לעבוד?

לא. המאגר הוא אוסף של עשרות ספריות ומודלים נפרדים. בוחרים את התיקייה הספציפית שמעניינת אתכם, למשל דגם תמלול או הקראה מסוים, ומורידים רק את קובץ ה־GGUF המבוקש לפי רמת הכימות שמתאימה לחומרה שלכם.

האם המודלים כאן יודעים לדבר או לתמלל בעברית?

המאגר כולל עשרות מודלים ממקורות שונים, ורובם מאומנים על אנגלית, סינית או שפות נפוצות אחרות. אם מודל המקור אינו תומך בעברית, ההמרה ל־GGUF לא תוסיף לו תמיכה כזו, לכן יש לבדוק את יכולות השפה של מודל הבסיס מראש.

איך יודעים מה מותר לעשות עם הקבצים מבחינה משפטית?

טבלת הקבצים בעמוד מפרטת את הרישיון המקורי של כל משפחה. אם בחרתם מודל ברישיון Apache-2.0 או MIT תוכלו לשלב אותו במוצר מסחרי, אבל אם הדגם תחת רישיון לא מסחרי תצטרכו להגביל אותו לניסויים בלבד.

איך מריצים

הרצת המודלים מתבצעת ישירות דרך כלי הפקודה audiocpp_cli, תוך העברת הנתיב לקובץ ה־GGUF הספציפי, הגדרת המשפחה והמשימה, ובחירת Backend מתאים כמו CUDA. אין צורך להוריד את כל המאגר ששוקל 588 גיגהבייט. מורידים רק את התיקייה של המודל הדרוש, כאשר מודלים קטנים ירוצו בקלות על מעבד או כרטיס מסך בסיסי, ודגמי ה־4 מיליארד פרמטרים ידרשו כרטיס מסך ייעודי עם מספיק זיכרון וידאו בהתאם לכימות.

אם אתם צריכים רק תמלול או הקראה פשוטה ולא רוצים לנהל סביבת C++ מקומית ותלויות חומרה, קריאה ל־API חיצוני תחסוך את כאב הראש. הריצה המקומית שווה את ההשקעה כשחייבים פרטיות מלאה, זמני תגובה מקומיים ללא רשת, או הפעלה במערכות סגורות.

ollama run hf.co/audio-cpp/audio.cpp-gguf:Q8_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

298 קבצים במאגר, 588 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון של המאגר מוגדר בתור other משום שאין רישיון אחיד. כל קובץ כפוף לרישיון של מודל המקור שלו. חלקם פתוחים לחלוטין כמו MIT ו־Apache-2.0, חלקם מגבילים שימוש מסחרי כמו CC-BY-NC-4.0, ואחרים מחייבים הסכמי קהילה מיוחדים. שימוש מסחרי מחייב בדיקה פרטנית של הדגם שבו בחרתם.

הרישיון המלא בעמוד המודל ↗