GPT
Z

Zipformer-30M-RNNT-6000h

קוד פתוח

hyntcc-by-nc-nd-4.02025-10-17

  • onnx

מודל תמלול קומפקטי לוייטנאמית שמתוכנן לרוץ מהר על מעבדים רגילים. הוא מיועד למי שחייב תמלול קולי מדויק בוייטנאמית בלי להחזיק שרתי כרטיסים גרפיים יקרים.

  • 227 MBמשקל הקבצים
  • 5,784הורדות בחודש
  • 57לייקים

מה זה

מדובר במודל זיהוי דיבור מבוסס ארכיטקטורת ZipFormer עם הפסד RNNT, שאומן על כ־6,000 שעות הקלטה בוייטנאמית ממגוון מאגרים ציבוריים. כל הקבצים שלו תופסים רק 227 מגה בייט, והוא כולל כ־30 מיליון פרמטרים. למרות הגודל המזערי, הוא מציג שיעורי שגיאות מילים נמוכים במיוחד במבחני VLSP בהשוואה למודלים כבדים בהרבה, כולל דגמים של יותר ממיליארד פרמטרים.

במבחני VLSP 2025 הוא השיג שיעור שגיאות של 7.97 אחוז במבחן הפומבי ו־8.1 אחוז בפרטי, תוצאה שעוקפת מודלים כמו PhoWhisper Large. עם זאת, במבחן GigaSpeech2 הוא הגיע ל־7.56 אחוז שגיאה לעומת 6.88 אחוז של מודל ZipFormer אחר שאומן על 70,000 שעות, כך שכמות הדאטה הנוספת עדיין נותנת יתרון במצבים מסוימים.

מתאים ל

  • תמלול שיחות קוליות בוייטנאמית

    הוא מפענח 12 שניות של שמע ב־0.3 שניות בלבד על מעבד, מה שמאפשר מענה שוטף במערכות טלפוניה.

  • הרצה מקומית על מעבדים פשוטים

    הגודל הקטן, 227 מגה בייט בלבד, מאפשר פריסה מהירה על שרתים פשוטים בלי כרטיס גרפי.

  • עיבוד קובצי שמע בוייטנאמית

    הוא השיג מקום ראשון בתחרות VLSP 2025 ומציג דיוק גבוה במיוחד בהשוואה למודלים גדולים ממנו.

איפה זה נופל

המודל מיועד אך ורק לשפה הוייטנאמית, ואין לו שום תמיכה בעברית או באנגלית. אם האודיו שלכם מכיל בליל שפות, הוא ייכשל. בנוסף, הוא נשען על המערכת של k2 ו־sherpa, מה שמחייב היכרות ועבודה עם הכלים האלה ולא סתם טעינה של שורה אחת מספריית transformers הרגילה.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה כדי לתמלל שיחות בעברית?

לא. המודל אומן אך ורק על כ־6,000 שעות של דיבור בוייטנאמית, ואין לו יכולת לזהות או לתמלל עברית כלל.

האם חייבים כרטיס גרפי חזק כדי לקבל זמני תגובה טובים?

לא, הוא מתוכנן במיוחד לריצה על מעבד רגיל ומבצע תמלול של 12 שניות שמע ב־0.3 שניות בסביבת מעבד בסיסית.

האם מותר להטמיע אותו במוצר של החברה שלנו?

לא, הרישיון הוא cc-by-nc-nd-4.0 שאוסר שימוש מסחרי ומגביל הפצה של שינויים במודל.

איך מריצים

המודל פועל מעל ספריות sherpa של פרויקט k2, ואפשר להריץ אותו באמצעות Torch JIT Script או בפורמט ONNX. בגלל המשקל הנמוך, אין שום צורך בכרטיס מסך ייעודי כדי לקבל ביצועים טובים. במעבד בסיסי הוא מתמלל 12 שניות של אודיו בתוך 0.3 שניות, ובכרטיס RTX 3090 הזמן יורד לפחות מעשירית השנייה.

אם אתם צריכים תמלול מקומי על השרת שלכם או על מכשירי קצה ללא גישה לרשת, ההרצה העצמית הזו פשוטה וחסכונית מאוד. פנייה לשירותי ענן חיצוניים שווה רק אם אתם לא רוצים להתעסק בכלל בהרכבת פייפליין של sherpa ו־k2 בקוד שלכם.

pip install -U huggingface_hub
hf download hynt/Zipformer-30M-RNNT-6000h

הרישיון

הרישיון הוא cc-by-nc-nd-4.0. המשמעות ברורה וחדה, אסור להשתמש בו לצרכים מסחריים, ואסור להפיץ גרסאות משופרות או שנגזרו ממנו. הוא מתאים למחקר, ניסויים פנימיים או פרויקטים אישיים, אבל אם אתם בונים מוצר בתשלום, אי אפשר לשלב אותו.

הרישיון המלא בעמוד המודל ↗