GPT
S

spelling-correction-english-base

קוד פתוח

oliverguhrmit2022-05-23

  • transformers
  • pytorch
  • tensorboard
  • onnx
  • safetensors

מודל קטן שמתקן שגיאות כתיב ופיסוק באנגלית. פתרון מקומי וזריז למי שרוצה לסדר טקסט בלי לפנות לשירות ענן חיצוני.

  • 139Mפרמטרים
  • 1,024טוקנים בהקשר
  • 2.8 GBמשקל הקבצים
  • 36,962הורדות בחודש

מה זה

מדובר במודל שמבוסס על ארכיטקטורת BartForConditionalGeneration עם 139 מיליון פרמטרים, שתפקידו לקחת טקסט באנגלית ולהחזיר אותו כשהוא מתוקן מתקלות הקלדה ובעיות פיסוק. הוא מוגדר במפורש כהוכחת היתכנות ניסיונית ולא כמוצר מדף גמור, אבל הגודל הקומפקטי שלו הופך אותו למועמד נוח לשילוב פנימי במערכות קיימות.

המפתח שחרר את הקוד לאימון עצמי כדי שתוכלו לאמן אותו גם על שפות אחרות אם תרצו. עם חלון הקשר של 1,024 טוקנים, הוא מתאים לעיבוד של משפטים או פסקאות בודדות ולא למסמכים כבדים. היתרון הגדול שלו הוא הפשטות, מקבלים משימה נקודתית בלי לגרור מודלים ענקיים שדורשים תשתיות יקרות מדי, אם כי אין בכרטיס המודל תוצאות מדידה מספריות של ביצועים או השוואה מול מודלים מתחרים.

מתאים ל

  • ניקוי קלט משתמשים באנגלית

    תיקון מהיר של שגיאות הקלדה בשדות טקסט חופשי או בחיפוש לפני העברת המידע להמשך עיבוד.

  • תיקון פלטים ממערכות שמע

    סידור פיסוק ותיקון כתיב של תמלול קולי באנגלית שיוצא ללא סימני פיסוק מספקים.

  • אימון מחדש לשפות נוספות

    שימוש בקוד הפתוח של הפרויקט כבסיס לאימון מודל דומה על דאטהסט ייעודי.

איפה זה נופל

היוצר מציין במפורש שהמודל נמצא בעבודה ועשוי לייצר ארטיפקטים בפלט, כלומר שינויים מוזרים, הזיות או עיוות של מילים מקוריות. הוא לא תומך בעברית כלל אלא באנגלית בלבד. לפני שמשלבים אותו בזרימת עבודה אמיתית, חובה להריץ בדיקות קפדניות על הנתונים שלכם ולוודא שהוא לא משבש משפטים תקינים תוך כדי ניסיון לתקן אותם.

שאלות
נפוצות

האם המודל יודע לתקן טקסט בעברית?

לא, המודל אומן על אנגלית בלבד. אם תזינו לו עברית תקבלו ככל הנראה שיבושים מוחלטים או חוסר תגובה, כך שהוא לא רלוונטי לטקסט ישראלי מקומי אלא אם כן תאמנו אותו מחדש.

האם אפשר להשתמש בו בלי כרטיס מסך?

כן, 139 מיליון פרמטרים זה נפח קטן מאוד במונחים של מודלי שפה. הוא ירוץ בקלות על CPU רגיל בכל סביבת פיתוח או שרת צנוע.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון באמצעות pipeline של text2text-generation. עם 139 מיליון פרמטרים ומשקל קבצים של כמעט שלושה גיגהבייט בדיוק float32, אין שום צורך במאיץ גרפי ייעודי, הוא ירוץ חלק על מעבד סטנדרטי בכל שרת פשוט או במחשב פיתוח.

אם יש לכם עומסים גבוהים מאוד של בקשות במקביל ואין לכם עניין לנהל שרתים, פנייה ל־API מסחרי תהיה פשוטה יותר. מנגד, לשימוש מקומי שבו המידע לא יכול לצאת החוצה, הריצה העצמית הזו דורשת מינימום משאבים.

from transformers import pipeline

pipe = pipeline("text-generation", model="oliverguhr/spelling-correction-english-base")
print(pipe("שלום"))

הרישיון

רישיון MIT פתוח ומתירני לחלוטין. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצר סגור, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗