GPT
G

gepard-1.0

קוד פתוח

nineninesixapache-2.02026-06-22

  • transformers
  • safetensors
  • qwen3_5_text
  • text-generation
  • text-to-speech

מודל המרת טקסט לדיבור קל משקל שמיועד לשיחות בזמן אמת. הוא מזרים אודיו תוך כדי יצירת הטקסט ומציע צליל טבעי מאוד על חומרה צנועה.

  • 556Mפרמטרים
  • 262,144טוקנים בהקשר
  • 1.1 GBמשקל הקבצים
  • 70,643הורדות בחודש

מה זה

המודל בנוי על שלד של Qwen3.5 עם 556 מיליון פרמטרים ומשתמש בקודק NanoCodec של אנבידיה. במקום לחכות לפסקה שלמה, המודל פועל בצורה אוטורגרסיבית שמייצרת פריימים של אודיו במעבר יחיד, מה שמאפשר לו להתחיל לדבר כמעט מיד כשהטקסט מתקבל. הוא תומך באנגלית, ספרדית, פורטוגזית והולנדית, וכולל אפשרות לשכפול קול מדגימה קצרה.

במבחני ביצועים הוא עוקף מודלים מקבילים במדדי איכות צליל וטבעיות כמו NISQA-MOS שבו קיבל 4.25, עם רמות רעש ועיוותים נמוכות במיוחד. המחיר של המבנה המהיר הזה מורגש בדיוק, שיעור טעויות המילים שלו עומד על 0.036 לעומת כ־0.016 במודלים מובילים אחרים, ודיוק שכפול הקול נמוך משמעותית מהמתחרים.

מתאים ל

  • סוכני קול בזמן אמת

    זמן תגובה של כ־50 מילישניות והזרמה רציפה מאפשרים לנהל שיחה קולית טבעית באנגלית בלי השהיות מורגשות.

  • הקראת טקסט על חומרה זולה

    משקל של 1.1 גיגה בייט מאפשר להריץ מודל דיבור איכותי מקומית על כרטיס מסך בודד בעלויות תשתית נמוכות.

  • מוקדי שירות מרובי שיחות

    היכולת להחזיק עד 256 שיחות במקביל על כרטיס בודד מתאימה למערכות מענה טלפוני שדורשות נפח גבוה.

איפה זה נופל

החיסרון הבולט ביותר הוא חוסר תמיכה בעברית. המודל מוגבל לארבע שפות בלבד, כאשר האיכות הגבוהה ביותר שמורה לאנגלית. מעבר לזה, שכפול הקול שלו חלש ביחס למתחרים עם ציון דמיון של 0.585, כך שהוא לא מתאים למי שחייב חיקוי מדויק של דובר מסוים. שיעור שגיאות המילים הגבוה יחסית דורש בדיקה מעמיקה אם אתם מתכננים להקריא שמות מורכבים או טקסטים טכניים.

שאלות
נפוצות

האם המודל תומך בהקראת טקסט בעברית?

לא. המודל מאומן רק על אנגלית בכמה מבטאים, ספרדית מקסיקנית, פורטוגזית ברזילאית והולנדית. הוא לא מזהה אותיות עבריות ולא יודע להגות אותן.

כמה מדויק שכפול הקול שלו מדגימת שמע קצרה?

השכפול עובד מכמה שניות של שמע, אבל הוא לא הצד החזק של המודל. במבחני דמיון קול הוא קיבל ציון נמוך של 0.585 לעומת מעל 0.8 במודלים מתחרים, כך שהאיכות תישמע טבעית אבל לא בהכרח זהה למקור.

האם חייבים להשתמש במימוש vLLM כדי לעבוד איתו?

הקוד המקורי בפייתורץ' משמש רק לבדיקות ולייחוס, והוא איטי בהרבה. כדי לקבל ביצועים שמתאימים לשיחה בזמן אמת ולנצל את המהירות המובטחת, חובה להריץ את גרסת ה־vLLM של הפרויקט.

איך מריצים

המשקל הכולל של הקבצים הוא 1.1 גיגה בייט בלבד, כך שכל כרטיס מסך מודרני מפעיל אותו בלי מאמץ. לביצועים של זמן אמת צריך להריץ אותו דרך התאמת ה־vLLM שפרסמו המפתחים, שמספקת מהירות של פי 25 מזמן אמת על RTX 5090 עם זמני תגובה של כ־50 מילישניות לפלח האודיו הראשון. על חומרה מקצועית כמו RTX Pro 6000 עם 96 גיגה זיכרון, הוא יכול להחזיק עד 256 שיחות במקביל.

אם אין לכם רצון להקים ולתחזק תשתית GPU כזו, המפתחים מציעים שירות ענן שמבוסס על ה־API של Cartesia. המחיר שם עומד על כחמישה דולר עבור כ־22 שעות אודיו, כך שלפרויקטים קטנים או לתקופת בדיקות אין סיבה אמיתית להרים שרת ייעודי.

from transformers import pipeline

pipe = pipeline("text-to-speech", model="nineninesix/gepard-1.0")
print(pipe("שלום"))

הרישיון

המודל והמשקולות שלו מפורסמים תחת רישיון Apache 2.0, שמתיר שימוש מסחרי חופשי ושינוי קוד. צריך לשים לב שרכיב הקודק מבית אנבידיה כפוף לרישיון NVIDIA Open Model License Agreement, כך שמי שמפיץ מוצר מסחרי צריך לוודא עמידה גם בתנאים של אנבידיה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗