GPT
S

sbert_punc_case_ru

קוד פתוח

kontur-aiapache-2.02022-07-21

  • transformers
  • safetensors
  • bert
  • token-classification
  • PyTorch

מודל ייעודי להחזרת פיסוק ואותיות גדולות ברוסית, במיוחד לפלט של תמלול דיבור. הוא מסווג טוקנים במקום לכתוב הכל מחדש, מה שחוסך משאבים.

  • 426Mפרמטרים
  • 512טוקנים בהקשר
  • 818 MBמשקל הקבצים
  • 7,752הורדות בחודש

מה זה

אם אתם מקבלים טקסט ברוסית ממנוע זיהוי קולי, סביר להניח שהוא מגיע כרצף מילים רציף באותיות קטנות ובלי סימני פיסוק. המודל הזה מתלבש על הבעיה הזו בדיוק. הוא מתבסס על sbert_large_nlu_ru ועושה פעולה של סיווג טוקנים, בדומה לזיהוי ישויות, כדי להחליט על כל מילה אם היא צריכה אות גדולה בהתחלה, אותיות גדולות בכל המילה, ואם להצמיד לה נקודה, פסיק או סימן שאלה.

במקום לקחת מודל שפה ענק שכותב את המשפט מהתחלה ועלול להמציא מילים, הוא רק מלביש 12 מחלקות קבועות של פיסוק ואותיות על הטקסט הקיים. הוא אומן על תמלולי ראיונות אמיתיים, כך שהוא מורגל לשפה מדוברת ולא רק למאמרים ערוכים.

מתאים ל

  • עיבוד פלט של תמלול שיחות

    הופך מלל גולמי שיוצא ממנועי דיבור לטקסט קריא עם חלוקה למשפטים ברוסית.

  • יצירת כתוביות לסרטונים

    מתקן אותיות גדולות ושמות עצם ברצף דיבור כדי שיוצגו נכון על המסך.

  • ניקוי טקסט לבוטים

    מסדר הודעות קוליות שנשלחות לצ'אטבוטים לפני שהן מועברות לשלב הניתוח.

איפה זה נופל

חלון ההקשר עומד על 512 טוקנים בלבד, כך שטקסט ארוך תצטרכו לחתוך לחתיכות ולנהל את החיבור ביניהן לבד. הוא יודע להחזיר רק נקודות, פסיקים וסימני שאלה. אל תצפו ממנו למירכאות, סימני קריאה או נקודתיים. מעבר לזה, הוא עובד ברוסית בלבד ולא יועיל בטקסטים מעורבים או בעברית, והוא אומן על ראיונות, אז הוא עלול לזייף מול שפה רשמית מדי או מושגים טכניים מורכבים.

שאלות
נפוצות

האם הוא מתאים לטקסט בעברית או באנגלית?

לא. המודל אומן ספציפית על רוסית ומתבסס על מודל בסיס רוסי. הרצה שלו על שפות אחרות לא תניב תוצאות תקינות.

מה הוא עושה אם הטקסט כבר מכיל אותיות גדולות?

הקוד של המודל מוריד את כל הטקסט לאותיות קטנות כשלב ראשון לפני הפיצוח. הוא מתעלם לחלוטין מהמצב המקורי ובונה את הפיסוק והאותיות מחדש.

האם המודל עלול לשנות מילים או להזות מידע?

לא, כי הוא לא מודל גנרטיבי. הוא מסווג טוקנים ורק מוסיף סימנים או משנה אותיות קטנות לגדולות, בלי לגעת במילים עצמן.

איך מריצים

עם משקל קבצים של 818 מגה בייט ודיוק חצי, לא צריך כאן שרת מפלצתי. אפשר להריץ אותו בלי בעיה על מעבד סביר או כרטיס מסך בסיסי עם 2 עד 4 גיגה זיכרון, ולקבל זמני תגובה מהירים מאוד.

ההתקנה נעשית ישירות מהמאגר של המודל דרך pip עם git-lfs, והוא כולל מחלקה פשוטה שעוטפת את כל תהליך הפילוח והפענוח. אם אתם מעבדים כמויות גדולות של שיחות מוקלטות או וידאו, אין שום סיבה לשלם ל־API חיצוני על פיסוק כשאפשר להחזיק תהליך עצמאי כזה מקומית כמעט בלי עלות שוטפת.

from transformers import pipeline

pipe = pipeline("token-classification", model="kontur-ai/sbert_punc_case_ru")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מאפשר להשתמש בו חופשי בפרויקטים מסחריים ופנימיים, לשנות אותו ולהפיץ אותו. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗