GPT
R

Raon-Speech-9B

קוד פתוח

KRAFTONcc-by-nc-4.02026-03-30

  • transformers
  • safetensors
  • raon
  • feature-extraction
  • speech

מודל שפה קולי בגודל 9B שיודע להאזין ולדבר ישירות באנגלית ובקוריאנית. הוא מאחד תמלול, הקראה ושיבוט קול תחת ארכיטקטורה אחת בלי לפרק את התהליך לכמה כלים נפרדים.

  • 9Bפרמטרים
  • 16.9 GBמשקל הקבצים
  • 3,197הורדות בחודש
  • 56לייקים

מה זה

מדובר במודל שמשלב בסיס טקסטואלי של Qwen3 יחד עם מקודד אודיו ייעודי מסוג Qwen3OmniMoe, קודק שמע בשם Mimi ומקודד דוברים ECAPA-TDNN. המבנה הזה מחבר הבנת דיבור והפקת דיבור לתוך מודל אחד, במקום לשרשר מודל תמלול נפרד, מודל שפה ומודל הקראה. הוא תומך בהמרת קול לטקסט, המרת טקסט לקול, שאלות ותשובות על בסיס קבצי שמע, ושיחה שמתחילה באודיו.

המפתחים בחנו את ביצועי ההזרמה שלו על כרטיסי RTX 6000 Pro ו־L40S מול מבחן LibriSpeech. ב־RTX 6000 Pro הוא מגיע לערך RTF של 0.27, שזה ייצור שמע במהירות של פי 3.7 מזמן אמת, עם זמן של 617 מילי-שניות עד לקבלת פיסת האודיו הראשונה. ב־L40S המהירות יורדת לפי 2.2 מזמן אמת וההמתנה לקטע הראשון עולה ל־887 מילי-שניות. הנתונים מראים שאפשר להגיע להזרמת דיבור שמישה, אבל כדי לקבל תגובה חלקה בלי השהיות מורגשות צריך כרטיס חזק למדי.

מתאים ל

  • עוזר קולי באנגלית או קוריאנית

    מאפשר לשוחח ישירות בקול ולשמוע מענה טבעי באנגלית או בקוריאנית ללא שרשור כלים נפרדים.

  • הקראת טקסט עם חיקוי קול

    מייצר דיבור שמתאים את עצמו לקול מקור קצר בעזרת קידוד מאפייני הדובר דרך ECAPA-TDNN.

  • מחקר על מודלי דיבור אחידים

    מתאים לבחינת ביצועי ארכיטקטורת Any-to-Any על גבי חומרה מקומית ללא עלויות רישוי מסחריות.

איפה זה נופל

החיסרון המרכזי כאן הוא מגבלת השפות. המודל אומן על אנגלית וקוריאנית בלבד, כך שאין לו תמיכה בעברית, לא בהבנה ולא בהפקה, וניסיון להזין לו קבצי שמע בעברית ייכשל. בנוסף, אף שמדובר במערכת אחת, שיחה קולית מלאה מחייבת הרצת קוד מותאם אישית שנטען מרחוק (trust_remote_code), מה שדורש בדיקת אבטחה קפדנית לפני הרצה בסביבות ארגוניות סגורות.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה בעברית?

לא. המודל אומן ספציפית על מאגרי נתונים באנגלית ובקוריאנית בלבד. הוא לא מזהה שמע בעברית ולא יודע להקריא טקסט בעברית.

איזה כרטיס מסך מינימלי צריך כדי להריץ אותו?

המשקלים תופסים 16.9GB, ולכן דרוש כרטיס עם לפחות 24GB זיכרון כמו RTX 3090, RTX 4090 או כרטיסים מקצועיים, במיוחד אם רוצים לשמור על זמני תגובה סבירים.

איך מריצים

משקל הקבצים עומד על 16.9 גיגה-בייט, כך שבטעינה בפורמט bfloat16 תצטרכו כרטיס מסך עם לפחות 24GB של זיכרון ייעודי כדי להחזיק את המודל ולהריץ עליו הסקת מסקנות בסיסית. אפשר להריץ אותו מקומית ישירות דרך ספריית transformers עם הפעלת trust_remote_code, וכדי להפעיל שיבוט קול לפי דגימת רפרנס צריך להתקין גם את חבילת speechbrain.

לפריסה מסודרת בסביבת שרתים המפתחים מציעים אימג׳ דוקר שמבוסס על vLLM-Omni ומספק נקודות קצה של API עבור תמלול והקראה. אם אין לכם חומרה מהשורה הראשונה כמו RTX 6000 Pro או L40S, להריץ מודל של תשעה מיליארד פרמטרים רק בשביל תמלול או הקראה בסיסית זה בזבוז משאבים מוחלט, ועדיף להשתמש במודלים ייעודיים קטנים יותר או בשירות ענן קיים.

from transformers import pipeline

pipe = pipeline("any-to-any", model="KRAFTON/Raon-Speech-9B")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון CC-BY-NC 4.0. זה אומר שמותר להוריד, לחקור, לפתח ולשנות את הקוד והמשקולות לצרכים פנימיים או מחקריים בלבד, תוך מתן קרדיט ליוצרים. שימוש מסחרי אסור לחלוטין, כך שאי אפשר לשלב אותו במוצר שמייצר הכנסות או מוצע כשירות בתשלום.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗