GPT
G

GigaAM-v3

קוד פתוח

ai-sagemit2025-11-19

  • pytorch
  • gigaam
  • automatic-speech-recognition
  • custom_code
  • ru

מודל זיהוי דיבור מבוסס Conformer שמתמקד ברוסית, מאומן על 700,000 שעות קול. הוא מציג שגיאות נמוכות משמעותית מוויספר בשיחות מוקד, דיבור טבעי והקלטות מאתגרות.

  • 428 MBמשקל הקבצים
  • 254,484הורדות בחודש
  • 153לייקים

מה זה

מדובר במודל של 220 עד 240 מיליון פרמטרים שמיועד לרוסית ולאנגלית, עם דגש מובהק על רוסית. הוא אומן מראש במתודולוגיית HuBERT, וכולל כמה וריאנטים, החל ממשקולות בסיס בשיטת CTC או RNN-T ועד גרסאות מקצה לקצה שמחזירות טקסט מנורמל ישירות כולל סימני פיסוק.

בבדיקות השגיאה Word Error Rate, גרסת ה־RNN-T מציגה ממוצע של 8.4 אחוזים לעומת 25.1 אחוזים של וויספר. הפער בולט במיוחד בהקלטות מוקדי שירות, שם הוא עומד על 9.5 אחוזי שגיאה מול 23.9, ובדיבור לא טיפוסי או משובש שבו המודל מגיע ל־19.2 אחוז לעומת כמעט 60 אחוז בוויספר. בהשוואות מקצה לקצה שנבדקו מול מודל שיפוט חיצוני, הוא ניצח את וויספר לארג' ביחס של 70 מול 30.

מתאים ל

  • תמלול שיחות במוקדי שירות

    המודל אומן על שיחות מוקד ומגיע ל־9.5 אחוזי שגיאה בלבד, שיפור ניכר מול וויספר.

  • הפקת כתוביות לפודקאסטים

    גרסאות ה־e2e מייצרות טקסט מנוקד ומפוסק ישירות מהקול, בלי צורך במודל פיסוק נפרד.

  • תמלול הקלטות עם רעשי רקע

    הוא אומן על קולות עם מוזיקת רקע ודיבור מרוחק ומציג שגיאות נמוכות מאוד בתנאים האלה.

איפה זה נופל

המודל ממוקד כולו ברוסית, ולמרות התמיכה באנגלית הוא לא רלוונטי בכלל לעברית או לשפות אחרות. מעבר לזה, כדי להריץ את הקוד צריך תלויות ספציפיות כמו pyannote-audio ו־torchcodec, והרצת קוד חיצוני ב־trust_remote_code דורשת בדיקה מקדימה לפני שדוחפים אותו לסביבת ייצור מאובטחת.

שאלות
נפוצות

האם המודל מתאים לתמלול בעברית?

לא. המודל תומך ברוסית ובאנגלית בלבד, וכל המיקוד שלו הוא שפה רוסית. אם תנסו להריץ עליו עברית תקבלו ג'יבריש מוחלט.

מה ההבדל בין גרסת ה־ctc לגרסת ה־rnnt?

גרסת ה־RNN-T מציגה דיוק גבוה יותר, עם 8.4 אחוזי שגיאה בממוצע לעומת 9.2 אחוזים בגרסת ה־CTC. מנגד, CTC לרוב מהיר ופשוט יותר להרצה מבחינת זמני שיהוי ומשאבים.

איך מריצים

טוענים אותו ישירות דרך Hugging Face עם הפקודה AutoModel, אבל חובה להגדיר trust_remote_code כחיובי ולבחור גרסה ספציפית בריוויז'ן, כמו e2e_rnnt או e2e_ctc. הקבצים שוקלים בסך הכל 428 מגה בייט, כך שכל כרטיס מסך בסיסי או שרת זול עם מעבד סביר יריצו אותו בלי בעיה ובזול.

גרסת ה־RNN-T מדויקת יותר אבל עשויה לדרוש יותר משאבים בזמן פענוח מגרסת ה־CTC. אם אתם צריכים תמלול שוטף של שיחות ברוסית, אין סיבה לשלם ל־API חיצוני, המשקל הנמוך שלו הופך הרצה עצמאית לפשוטה ומשתלמת בהרבה.

pip install -U huggingface_hub
hf download ai-sage/GigaAM-v3

הקבצים

6 קבצים במאגר, 428 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון MIT מלא. אפשר להשתמש במודל למוצרים מסחריים, לשנות אותו, להטמיע בקוד סגור ולהפיץ הלאה בלי תשלום. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים של הפרויקט המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗