GPT
T

t5-base-grammar-correction

קוד פתוח

vennifycc-by-nc-sa-4.02022-03-02

  • transformers
  • pytorch
  • t5
  • text2text-generation
  • grammar

מדובר בהתאמה של T5 שמיועדת כולה למטרה אחת בלבד, תיקון שגיאות דקדוק באנגלית. הוא שוקל פחות מגיגהבייט ורץ בקלות מקומית בלי לערב שירותים חיצוניים.

  • 512טוקנים בהקשר
  • 853 MBמשקל הקבצים
  • 96,579הורדות בחודש
  • 183לייקים

מה זה

הבסיס כאן הוא T5 בגרסת base שעבר אימון על גבי דאטהסט שנקרא JFLEG באמצעות ספריית Happy Transformer. המטרה מוגדרת וצרה מאוד, קבלת טקסט באנגלית עם שגיאות והחזרת גרסה מתוקנת שלו, תוך שמירה על המשמעות המקורית ככל האפשר.

במקום להחזיק מודל ענק שיודע לעשות הכל מהסברים ועד כתיבת קוד, יש לכם פה משקל של 853 מגהבייט שמתרכז רק בלשון. הוא לא מנסה לשכתב סגנון שלם או לנחש כוונות נסתרות, אלא בעיקר לסדר בעיות תחביר, איות ודקדוק של משפטים בודדים או קצרים, כל עוד מוסיפים את התחילית הנדרשת לקלט.

מתאים ל

  • תיקון מיילים באנגלית

    ניקוי שגיאות הקלדה ודקדוק בטקסטים קצרים שנשלחים באנגלית לפני שליחה.

  • הטמעה בכלי כתיבה פנימי

    הרצה מקומית על שרת ארגוני ללא תלות ברשת וללא שליחת מידע החוצה.

  • בדיקת תוכן משתמשים

    סינון ותיקון אוטומטי של הערות או שדות קלט קצרים במערכות לא מסחריות.

איפה זה נופל

חלון ההקשר עומד על 512 טוקנים בלבד, כך שאי אפשר להזין אליו פסקאות ארוכות או מסמכים שלמים בבת אחת בלי לחתוך אותם קודם למשפטים. חוץ מזה, הוא אומן רק על אנגלית, אין מה לנסות להריץ עליו עברית כי תקבלו פלט שבור או חסר תועלת. הוא גם מחייב הוספה ידנית של התחילית grammar: לפני כל קלט, ואם תשכחו אותה המודל פשוט לא יעשה את העבודה.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לתיקון טקסטים בעברית?

לא, המודל אומן על אנגלית בלבד ולא מזהה עברית. ניסיון להזין לו שפות אחרות יניב פלט משובש לחלוטין.

האם מותר לשלב אותו באפליקציה בתשלום?

הרישיון שלו אוסר שימוש מסחרי באופן מפורש. אם האפליקציה שלכם מייצרת הכנסה או שייכת לחברה מסחרית, אי אפשר להשתמש בו חוקית.

איך מריצים

הרצה מקומית דורשת בסך הכל התקנה של happytransformer או שימוש בסיסי בספריית transformers הרגילה. עם משקל של 853 מגהבייט, אפשר להריץ אותו בקלות על כל כרטיס מסך ביתי ממוצע, וגם מעבד רגיל יסחב אותו יפה בלי בעיות זיכרון מיוחדות.

אם כל מה שאתם צריכים זה לתקן כמה משפטים פה ושם בתוך מוצר קיים, עדיף להריץ אותו אצלכם בשרת ולא לשלם לספקי API לפי טוקנים. פשוט טוענים אותו, מעבירים את הטקסט עם התחילית grammar: ומקבלים תוצאה.

from transformers import pipeline

pipe = pipeline("text-generation", model="vennify/t5-base-grammar-correction")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 853 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא cc-by-nc-sa-4.0, וזה הדבר הכי חשוב לשים לב אליו כאן. האותיות NC אומרות שאין שום היתר לשימוש מסחרי, ו־SA מחייב שיתוף של נגזרות תחת אותו רישיון בדיוק. אם אתם בונים פיצ'ר למוצר שנמכר בכסף, המודל הזה פסול עבורכם.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗