GPT
P

PhoWhisper-large

קוד פתוח

vinaibsd-3-clause2023-12-19

  • transformers
  • pytorch
  • whisper
  • automatic-speech-recognition
  • vi

גרסה מכווננת של וויספר לזיהוי דיבור בווייטנאמית, שעברה אימון על מגוון מבטאים מקומיים. היא מיועדת למי שצריך תמלול מדויק לשפה הזו ולא מסתפק במודל הרב־לשוני הרגיל.

  • 5.8 GBמשקל הקבצים
  • 5,247הורדות בחודש
  • 46לייקים
  • 32שכבות

מה זה

מדובר בהתאמה ייעודית של ארכיטקטורת Whisper של OpenAI עבור השפה הווייטנאמית בלבד, שפותחה על ידי VinAI. המפתחים לקחו את המודל הגדול וביצעו כוונון עדין על גבי מאגר של 844 שעות הקלטה, שכלל מבטאים שונים מרחבי וייטנאם כדי להתמודד עם פערי הדיבור האזוריים במדינה.

במקום להסתמך על הגרסה הרב־לשונית הכללית של וויספר, שמכירה וייטנאמית שטחית יחסית, המודל הזה מתמקד רק בה ומציג ביצועים מובילים במבחני השוואה לשפה הזו. אם המוצר שלכם פונה לשוק הווייטנאמי, אין שום סיבה להשתמש בוויספר המקורי כשיש מודל שעבר התאמה עמוקה כל כך.

מתאים ל

  • תמלול שיחות בווייטנאמית

    אידיאלי לעיבוד הקלטות של לקוחות מווייטנאם, בזכות אימון ייעודי על מבטאים אזוריים שונים במדינה.

  • זיהוי פקודות קוליות

    מתאים לשילוב ברכיבים מקומיים שדורשים קליטת דיבור בווייטנאמית בדיוק גבוה בהרבה מוויספר הבסיסי.

  • כתוביות לווידאו מקומי

    מייצר תמלול מדויק לתוכן וידאו בשפה הווייטנאמית בלי לפספס סלנג או ניואנסים של הגייה מקומית.

איפה זה נופל

הבעיה המרכזית ברורה, אין כאן תמיכה בעברית, באנגלית או באף שפה חוץ מווייטנאמית. מעבר לכך, הכרטיס מציין שהאימון כלל 844 שעות בלבד, שזה היקף נאה למבטאים מקומיים אך צנוע ביחס למאגרי ענק, ולכן סביר שהוא יתקשה בהקלטות רועשות במיוחד או ברקע של רחוב.

שאלות
נפוצות

האם המודל מזהה עברית או אנגלית?

לא. למרות שהבסיס שלו הוא וויספר המקורי, הגרסה הזו עברה כוונון ייעודי וממוקדת אך ורק בשפה הווייטנאמית. לכל שפה אחרת תצטרכו להשתמש במודל אחר.

האם שווה להריץ אותו במקום המודל הכללי של OpenAI?

רק אם יש לכם צורך מובהק בתמלול וייטנאמית. במקרה כזה התוצאות יהיו מדויקות יותר בזכות ההתאמה למבטאים, אבל הוא תופס את אותם משאבי חומרה כבדים של מודל large.

איך מריצים

המשקל הכולל של הקבצים מגיע לכמעט שישה גיגה־בייט בדיוק מלא, כך שתצטרכו כרטיס מסך עם לפחות שמונה עד עשרה גיגה זיכרון כדי לטעון אותו ולתמלל בצורה יציבה עם transformers. אפשר לנסות לכווץ את הדיוק בחצי כדי לחסוך מקום, אבל זה עדיין מודל של 32 שכבות שדורש משאבים.

אם אתם לא מעבדים כמויות שמע קבועות או אין לכם תשתית שרתים פנויה, החזקה של שרת ייעודי רק בשבילו תעלה לא מעט. במקרים של עומס נמוך עדיף לבדוק אם יש שירות שמארח אותו לפי קריאה במקום לנהל את החומרה לבד.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="vinai/PhoWhisper-large")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון bsd-3-clause, שהוא רישיון קוד פתוח מתירני מאוד. מותר להשתמש בו במוצרים מסחריים, לשנות אותו ולסגור את הקוד. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והסרת האחריות של המפתחים המקוריים, יחד עם איסור שימוש בשמם לצורכי קידום מכירות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗