GPT
A

A.X-K2-Raon-Speech-21B-A3B

קוד פתוח

KRAFTONcc-by-nc-4.02026-07-27

  • transformers
  • safetensors
  • raon
  • feature-extraction
  • speech

מודל קול מרובה משימות של 21 מיליארד פרמטרים שרץ עם 3.5 מיליארד פעילים בכל רגע. הוא פונה למי שצריך תמלול, יצירת דיבור ושיחה קולית באנגלית וקוריאנית תחת ארכיטקטורת תערובת מומחים אחת.

  • 21Bפרמטרים
  • 39.5 GBמשקל הקבצים
  • 15,547הורדות בחודש
  • 104לייקים

מה זה

מדובר במודל any-to-any שמחבר מנוע טקסט מסוג תערובת מומחים של SK Telecom עם מקודד דיבור עצמאי וקודק אודיו מובנה. במקום לשרשר מודל Whisper נפרד, מודל שפה ומודל דיבור נפרד, הקלט והפלט הקוליים עוברים ישירות דרך המשקלים שלו. הוא מבצע תמלול, הקראת טקסט, שיבוט קול מדגימת ייחוס, מענה לשאלות מוקלטות ושיחה רציפה.

בבנצ'מרקים המודל הגיע למקום הראשון בקוריאנית ולמקום השלישי באנגלית מבין מודלים קוליים פתוחים בגודל של עד 30 מיליארד פרמטרים, עם ציון משוקלל של 0.72 לקוריאנית ו־0.75 לאנגלית. החידוש העיקרי כאן מול מודלים רגילים בגודל הזה הוא השימוש בארכיטקטורת תערובת מומחים עם 128 מומחים וניתוב של שמונה פעילים. בזכות המבנה הזה מקבלים כושר ייצוג של מודל ענק, אבל חישוב של 3.5 מיליארד פרמטרים בלבד בזמן ריצה.

מתאים ל

  • בוט קולי באנגלית לקול סנטר

    מאפשר מענה ישיר מקול לקול וחיבור לכלים חיצוניים בלי שרשור מודלים נפרדים.

  • שיבוט והמשכיות קול לקריאה

    מייצר דיבור מדגימת קול חיצונית ושומר על רצף אינטונציה טבעי של הדובר המקורי.

  • תמלול ושאלות על הקלטות

    מבין ישירות תוכן אודיו באנגלית ומאפשר תשאול בטקסט או בקול ללא שלב תמלול מקדים.

איפה זה נופל

התמיכה המובנית מוגבלת באופן מוחלט לאנגלית וקוריאנית בלבד. אם תזינו עברית, המקודד והקודק פשוט לא אומנו עליה, והתוצאות יהיו שגויות או חסרות משמעות. מעבר לכך, מדדי איכות הקול מראים פערים. במדד PESQ הקודק קיבל 83.5% יחסית למודל Mimi, מה שאומר שהשחזור האקוסטי פחות נקי ממודלים ייעודיים מסוימים. תהליך הפוסט-אימון שיפר את שגיאות הדיבור ל־3.1%, אך תופעות של הברות מוארכות או סיומות לא שלמות עדיין יכולות להופיע. בנוסף, חלון ההקשר בשרת vLLM מוגבל ל־4096 טוקנים בלבד, למרות שמנוע הטקסט תומך ביותר.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. המודל אומן ונבדק על אנגלית וקוריאנית בלבד, הן בשכבת השפה והן במקודדי הקול. ניסיון להזין אודיו בעברית או לבקש פלט בעברית לא יעבוד בצורה תקינה.

האם אפשר להריץ אותו על כרטיס מסך ביתי כמו RTX 3090 או 4090?

לא באופן ישיר. המודל דורש כ־42.4 גיגה-בייט זיכרון גרפי רק למשקלים, והסביבה הרשמית דורשת כרטיס של 80 עד 96 גיגה-בייט. תצטרכו מערך של לפחות שניים או שלושה כרטיסים ביתיים או קוונטיזציה שאינה חלק מההפצה המקורית.

האם מותר להשתמש בו במוצר מסחרי?

לא. הרישיון המוגדר הוא CC BY-NC 4.0, שאוסר מפורשות על כל שימוש למטרות רווח או הפעלה במוצרים מסחריים.

איך מריצים

המשקלים בפורמט bfloat16 תופסים כ־42.4 גיגה-בייט בזיכרון, ולכן כרטיס ביתי רגיל לא יספיק לכם כאן. להרצה מקומית ב־transformers היצרן ממליץ על מאיץ גרפי של 80 גיגה-בייט או חלוקה למספר כרטיסים. אם רוצים להרים שרת מרובה משתמשים עם תמיכה ב־vLLM, הפרופיל שסופק דורש כרטיס יחיד עם כ־96 גיגה-בייט של זיכרון גרפי, ענף ייעודי של vLLM-Omni והשבתה של מנגנון MLA בגלל רוחב ה־KV-cache.

ההתקנה כוללת תלויות נוספות כמו speechbrain עבור יצירת דיבור מותנית קול, וקוד מותאם אישית שחובה לטעון עם trust_remote_code. אם אין לכם גישה למאיצי שרת מתקדמים עם 80 עד 96 גיגה-בייט זיכרון פנוי, אין טעם לנסות להריץ אותו מקומית, עדיף להשתמש בפתרונות ענן חיצוניים או לחכות לגרסאות מכווצות.

from transformers import pipeline

pipe = pipeline("any-to-any", model="KRAFTON/A.X-K2-Raon-Speech-21B-A3B")
print(pipe("שלום"))

הרישיון

המשקלים משוחררים תחת רישיון CC BY-NC 4.0 שמונע כל שימוש מסחרי, ומתיר מחקר ויצירת אב-טיפוס בלבד. קוד המקור של מנוע הטקסט שומר על רישיון Apache 2.0, אבל המודל השלם מוגבל על ידי התנאי הלא-מסחרי. מי שבונה מוצר שמייצר הכנסות לא יכול לשלב את המודל הזה כפי שהוא.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗