GPT
X

xlm-roberta_punctuation_fullstop_truecase

קוד פתוח

1-800-BAD-CODEapache-2.02023-05-07

  • generic
  • onnx
  • nemo
  • text2text-generation
  • punctuation

הכלי מוסיף סימני פיסוק, אותיות גדולות וחלוקה למשפטים בטקסט גולמי רב־לשוני. הוא נותן מענה מהיר להפיכת תמלילי שמע קוליים לקריאים בלי צורך במודל שפה ענק.

  • 2.1 GBמשקל הקבצים
  • 306,589הורדות בחודש
  • 69לייקים

מה זה

בבסיסו יושב XLM-RoBERTa שעבר כוונון ייעודי לטיפול בשלושה דברים במקביל: הוספת סימני פיסוק, זיהוי גבולות משפט והחזרת אותיות גדולות, תהליך שמכונה true-casing, ב־47 שפות שונות. הרשת מבצעת חיזוי לפני ואחרי כל תת־מילה, מה שמאפשר לה לתמוך במאפיינים ייחודיים של שפות כמו סימן שאלה הפוך בספרדית, סימנים ייעודיים בערבית, יוונית ואמהרית, או ראשי תיבות מורכבים.

המבנה מקשר בין המשימות. התוצאה של סימני הפיסוק מוזנת ישירות לראש שמזהה את סופי המשפטים, והחיזוי של סוף המשפט מוזז קדימה כדי לכוון את הראש שאחראי על אותיות גדולות בתחילת המשפט הבא. במבחנים על אנגלית, כשהפיסוק כבר נתון, זיהוי סופי המשפטים מגיע לדיוק של מעל 99%, אבל בחיים האמיתיים המודל מנחש את הפיסוק בעצמו ולכן שגיאה אחת בשלב מוקדם גוררת שגיאות בהמשך השרשרת.

מתאים ל

  • עיבוד תמלילי שמע באנגלית

    הוספת סימני פיסוק וחלוקה למשפטים עבור פלט גולמי ממנועי תמלול דיבור לטקסט.

  • תיקון אותיות גדולות בשפות זרות

    זיהוי נכון של שמות עצם, ראשי תיבות ותחילת משפט בטקסט שהוקלד כולו באותיות קטנות.

  • חיתוך משפטים להזנה במודלים

    פירוק פסקאות ארוכות למשפטים בודדים לפי גבולות לוגיים אמיתיים לפני תרגום מכונה.

איפה זה נופל

היוצר מציין במפורש שהמודל כנראה לא ברמת פרודקשן. האימון התבסס על חדשות מאתר WMT עם כמיליון שורות לשפה בלבד, ולכן בטקסטים משיחות יומיומיות, סלנג או שפה לא רשמית הוא מתקשה.

יש לו נטייה מובהקת לייצר יותר מדי פסיקים. בספרדית הוא דוחף סימני שאלה הפוכים בכמות מוגזמת בגלל דגימת יתר בזמן האימון, והדיוק שלו על סימני שאלה בספרדית עומד על כ־53% בלבד. עברית אינה מופיעה ברשימת השפות המפורטת בכרטיס, כך שלטקסט מקומי הוא פשוט לא רלוונטי.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה עבור טקסט בעברית?

לא. רשימת השפות הנתמכות כוללת אנגלית, ערבית, ספרדית, גרמנית, אמהרית, יוונית, בולגרית ובנגלה, לצד שפות נוספות שנאספו מקורפוס החדשות, אך עברית אינה מופיעה ברשימת השפות של המודל ולא נתמכת בסימני הפיסוק הייחודיים שלו.

האם המודל מתאים לשיפור תמלילים של שיחות שירות לקוחות מוקלטות?

לא הייתי ממהר להכניס אותו לשם. הוא אומן על מיליון משפטים של כתבות חדשותיות רשמיות בלבד, והיוצר מבהיר שהביצועים על שפה מדוברת ויומיומית צפויים להיות נמוכים באופן משמעותי.

איך מריצים

המשקל הכולל עומד על 2.1 גיגה־בייט הפרוסים על פני 8 קבצים, והריצה מתבצעת בעיקר דרך קבצי ONNX ומודל SentencePiece שעבר תיקון ידני. אפשר להתקין את ספריית punctuators מ־PyPI ולהריץ אצווה של מחרוזות ישירות בפייתון, או לטעון את קובץ ה־ONNX עצמאית בכל סביבת ריצה שתומכת בו.

בזכות פורמט ה־ONNX אין צורך במעבד גרפי כבד. אפשר להריץ אותו מקומית על מעבד רגיל של שרת או מחשב פיתוח, והוא יספק זמני תגובה טובים לאצוות טקסט קצרות. אם המוצר שלכם צריך לטפל בנפחים עצומים של שיחות מוקלטות בזמן אמת בלי לנהל תשתית שרתים, פנייה לשירותי ענן ייעודיים תחסוך תחזוקה, אבל לשימוש עצמאי או מקומי הוא קל מאוד לתפעול.

pip install -U huggingface_hub
hf download 1-800-BAD-CODE/xlm-roberta_punctuation_fullstop_truecase

הקבצים

8 קבצים במאגר, 2.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והמשקלים והפצה שלהם בתוך מוצרים סגורים, בלי דרישה לפתוח את הקוד שלכם. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והצהרת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗