GPT
G

GigaChat3.1-Audio-10B-A1.8B

קוד פתוח

ai-sagemit2026-07-13

  • transformers
  • safetensors
  • gigachat_audio
  • text-generation
  • audio

מודל שמע מבוסס תערובת מומחים שיודע לעבד הקלטות שלמות. הוא מאתר רגעים מדויקים בתוך קבצי קול ארוכים ומסכם אותם לפי חותמות זמן.

  • 262,144טוקנים בהקשר
  • 22.1 GBמשקל הקבצים
  • 264,843הורדות בחודש
  • 53לייקים

מה זה

הארכיטקטורה משלבת מקודד דיבור מטיפוס Conformer ישירות לתוך מפענח שפה מסוג Mixture of Experts, כאשר 1.8 מיליארד פרמטרים פעילים מתוך עשרה מיליארד. השילוב הזה נותן לו יכולת לעבד אודיו של שעה או שעתיים ברצף בלי לחתוך אותו למקטעים קצרים מראש.

במדדי מיקום בזמן, המודל עוקף מתחרים פתוחים כמו Voxtral ו־Qwen3-Omni בפער ניכר, עם ציון התאמה של 48.9 באודיו של שעה עד שעתיים לעומת פחות מ־5 של האחרים. הוא חזק מאוד בהבנת רגשות ובשאלות על תוכן קולי ברוסית, אבל בתמלול אנגלית נקי הוא משיג 6.5 אחוזי שגיאה, תוצאה חלשה יותר ממתחריו.

מתאים ל

  • איתור קטעים בהרצאות ארוכות

    הוא מוצא בדיוק באילו דקות ושניות נושא מסוים הוזכר בתוך הקלטה של שעתיים.

  • סיכום פגישות עם חותמות זמן

    הוא מפיק סיכום מובנה שמצמיד לכל החלטה או אירוע את הזמן המדויק שבו הם קרו.

  • סיווג רגשות במוקדי שירות

    הוא מזהה רגשות וטונים בהקלטות דיבור ברוסית עם דיוק של מעל 90 אחוזים לפי המבחנים.

איפה זה נופל

החיבור של רכיב האודיו פגע ביכולות הטקסטואליות הטהורות לעומת מודל הבסיס, עם ירידה של יותר מתשע נקודות במבחן MMLU-Pro וירידה של שבע נקודות ב־BBH. המודל מיועד רשמית רק לרוסית ואנגלית, ואין בו שום תמיכה בעברית. בנוסף, הוא דורש הרצת קוד מותאם אישית מהרשת כדי לפעול, מה שמחייב בדיקת אבטחה לפני שמכניסים אותו לסביבת ייצור.

שאלות
נפוצות

האם המודל מתאים לעיבוד שיחות מוקלטות בעברית?

לא. המודל אומן והוגדר רשמית עבור אנגלית ורוסית בלבד, ואין לו יכולת תמלול או הבנה של שמע בעברית. ניסיון להזין לו הקלטות מקומיות יניב פלט משובש או תמלול שגוי לחלוטין.

האם חייבים להריץ אותו דרך ספריית vLLM בלבד?

לא חובה, אפשר לטעון אותו גם ישירות דרך ספריית transformers הרגילה בעזרת AutoModelForCausalLM. עם זאת, vLLM מאפשרת להפעיל את המקודד והמפענח יחד ביעילות גבוהה ושומרת על קצב הפקה מהיר גם כשההקלטה תופסת עשרות אלפי טוקנים.

איך מריצים

המשקל הכולל של הקבצים עומד על 22.1 גיגה בייט בדיוק bfloat16, כך שצריך כרטיס מסך בודד עם 24 גיגה זיכרון כדי להעלות אותו, או מאיץ חזק יותר כמו H100 כדי לנצל את מלוא ההקשר של 262 אלף טוקנים. לפי המדידות, שרת עם H100 יחיד מחזיר בין 211 ל־242 טוקנים לשנייה תחת ספריית vLLM.

ההרצה דורשת שימוש בקוד מרוחק עם trust_remote_code בספריית transformers, וגרסאות מוגדרות של תלויות כולל flash-attn. מי שמחפש רק תמלול בסיסי של שיחות קצרות עדיף שישתמש בשירות ענן רגיל במקום להחזיק תשתית ייעודית למודל כזה.

from transformers import pipeline

pipe = pipeline("text-generation", model="ai-sage/GigaChat3.1-Audio-10B-A1.8B")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון MIT סטנדרטי. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים המקורית. אין שום מגבלות שימוש נוספות או דרישה לפתוח קוד שנבנה סביבו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗