GPT
B

Borealis

קוד פתוח

Vikhrmodelsapache-2.02025-09-11

  • transformers
  • pytorch
  • borealis
  • text-generation
  • automatic-speech-recognition

מודל תמלול ייעודי לרוסית ששוקל קצת מעל 2 גיגהבייט. אם אתם צריכים תמלול רוסית מדויק שכולל פיסוק מלא בלי לשלם על API חיצוני, זה הכיוון.

  • 2.1 GBמשקל הקבצים
  • 69,247הורדות בחודש
  • 54לייקים

מה זה

מדובר במודל ASR שמבוסס על ארכיטקטורה בסגנון Voxtral ואומן על כ־7000 שעות של הקלטות ברוסית. הייחוד המרכזי שלו מול פתרונות קיימים הוא היכולת להוציא טקסט מתומלל עם סימני פיסוק ישירות מהקופסה, במקום לפלוט רצף מילים גולמי שמצריך מעבר של מודל שפה נוסף.

במדדי השגיאות שהמפתחים הציגו, הוא מציג WER ממוצע של 6.33 אחוזים. זה שם אותו בביצועים עדיפים משמעותית על פני משפחת Whisper של OpenAI ברוסית, כולל גרסת ה־large-v3 שמגיעה למעל עשרה אחוזי שגיאה באותם מבחנים. הוא אמנם מפסיד במעט למודל GigaAM-ASR-V2-RNNT בממוצע הכולל, אבל מנצח אותו בבדיקות של ספרי שמע וב־Common Voice.

מתאים ל

  • תמלול שיחות ברוסית

    זיהוי דיבור מדויק שכולל פיסוק מובנה, מצוין למוקדי שירות או להקלטות ראיונות.

  • המרת ספרי שמע לטקסט

    התוצאות במבחן Books מציגות 5.28 אחוזי שגיאה, נמוך בהרבה מרוב המודלים הפתוחים.

  • הרצה מקומית זולה

    משקל של 2.1 גיגהבייט מאפשר תמלול פרטי על גבי חומרה צנועה בלי להוציא מידע לרשת.

איפה זה נופל

המודל תומך רק בשפה הרוסית. אם תזרקו עליו עברית, אנגלית או שיחה מעורבת, הוא פשוט לא יידע מה לעשות איתן. בנוסף, בבנצ'מרק של Sova שיעור השגיאות שלו קופץ ל־15.37 אחוזים, מה שמראה שבהקלטות קשות או בתנאי רעש מסוימים הדיוק שלו נשחק באופן מורגש ביחס לביצועים בספרי שמע. חובה לבדוק אותו על סגנון ההקלטות האמיתי שלכם ולא להסתמך רק על הממוצע הכללי.

שאלות
נפוצות

האם הוא יודע לתמלל עברית?

לא. המודל אומן אך ורק על רוסית ומוגדר לשפה הזו בלבד. בשביל עברית תצטרכו להשתמש במודלים רב־לשוניים כמו Whisper או במודל ייעודי לעברית.

איך הוא מתמודד עם סימני פיסוק?

בניגוד לחלק גדול ממודלי ה־ASR שמוציאים רק מילים באותיות קטנות, המודל הזה אומן להחזיר פסיקים ונקודות כחלק מתהליך התמלול. זה חוסך שלב עיבוד נוסף בצינור הנתונים שלכם.

איך מריצים

המשקל הכולל של הקבצים עומד על 2.1 גיגהבייט בדיוק של bfloat16, כך שמדובר במודל קל מאוד. כרטיס מסך בסיסי עם 6 עד 8 גיגהבייט של VRAM יריץ אותו בלי למצמץ דרך ספריית transformers הרגילה, ויש גם הדגמה זמינה ב־Colab כדי לבדוק אותו לפני שמורידים.

אם אתם מריצים שרת מקומי או צריכים לעבד נפחים גדולים של שיחות ברוסית, להחזיק מודל כזה על חומרה משלכם זול משמעותית מכל שירות ענן. עדיף לפנות ל־API מסחרי רק אם אתם לא רוצים לתחזק שרתים בכלל או אם האודיו שלכם משלב כמה שפות באותה שיחה.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="Vikhrmodels/Borealis")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהטמיע אותו במוצרים שלכם בלי לשלם תמלוגים. התנאי היחיד הוא שמירת הקרדיט למפתחים והודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗