GPT
A

autonlp-Gibberish-Detector-492513457

קוד פתוח

madhurjindalmit2022-03-02

  • transformers
  • pytorch
  • onnx
  • safetensors
  • distilbert

מסווג טקסט זעיר שמזהה ג'יבריש וקלט חסר פשר באנגלית. הוא חוסך קריאות יקרות ל־LLM גדול כשמשתמשים מקלידים שטויות או ספאם לתוך המערכת.

  • 67Mפרמטרים
  • 512טוקנים בהקשר
  • 768 MBמשקל הקבצים
  • 59,185הורדות בחודש

מה זה

במקום להסתפק בבדיקה בינארית של תקין מול לא תקין, המודל הזה מפצל את הבעיה לארבע רמות מוגדרות: רעש מקלדת מוחלט, בליל מילים אמיתיות בלי קשר הגיוני, משפטים שבורים עם שגיאות תחביר גסות, וטקסט נקי לחלוטין. הוא נבנה על גבי DistilBERT באמצעות תהליך האימון של AutoNLP, מה שנותן לו גודל מינימלי בלי לוותר על הבנת הקשר של רשת טרנספורמר.

במדדי הוולידציה שלו הוא מציג דיוק כולל של 97.36%, ורמות ה־F1 וה־Precision שלו מאוזנות סביב אותו מספר בדיוק בכל ארבע הקטגוריות. המשמעות בפועל היא שהוא לא סתם מנחש את המחלקה הנפוצה ביותר, אלא מזהה באותה רמת אמינות גם הקלדות אקראיות על המקלדת וגם משפטים מתוחכמים יותר שנראים שלמים ממבט ראשון אבל חסרי פשר.

מתאים ל

  • סינון קלט לצ'אטבוטים

    חוסם שאילתות זבל לפני שהן נשלחות למודל שפה גדול ויקר, וחוסך עלויות טוקנים.

  • ניקוי דאטהסטים

    מנקה סריקות רשת ומאגרי טקסט גדולים מג'יבריש ורעש מקלדת לפני תהליכי אימון.

  • סינון ספאם בפורומים

    מזהה פוסטים שנוצרו על ידי בוטים או רצפי מילים אקראיים כדי להפחית עומס ממנחים.

איפה זה נופל

המודל אומן על אנגלית בלבד. אם תזרקו עליו עברית, הוא פשוט לא יידע מה לעשות איתה ויסווג אותה בצורה שגויה כרעש בגלל הטוקנייזר. בנוסף, חלון ההקשר שלו מוגבל ל־512 טוקנים, כך שהוא מתאים לבדיקת הודעות צ'אט או משפטים בודדים, ולא לבדיקת מאמרים ארוכים.

הכרטיס לא חושף את מערך הנתונים המדויק שעליו התבצע האימון. צריך לבדוק היטב איך הוא מגיב לשמות מותגים, סלנג טכנולוגי או שמות פרטיים שאינם נפוצים באנגלית, לפני שחוסמים משתמשים על בסיס התוצאה שלו.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. המודל אומן על אנגלית בלבד. טקסט בעברית יתפרק לטוקנים שבורים ויזוהה כרעש או ג'יבריש באופן אוטומטי.

מה הדרישות כדי להריץ אותו בשרת ייצור?

מעבד סטנדרטי עם ליבה אחת ופחות מגיגה־בייט אחד של זיכרון RAM פנוי יספיקו כדי לקבל זמני תגובה של מילישניות בודדות.

מה ההבדל בין Noise לבין Word Salad במודל הזה?

נויז מתייחס לרצפי תווים חסרי פשר כמו הקלדה אקראית, בעוד וורד סלד מכיל מילים תקינות לחלוטין באנגלית שמחוברות יחד בלי שום היגיון תחבירי או סמנטי.

איך מריצים

המשקל הכולל של הקבצים עומד על 768 מגה־בייט עם כ־67 מיליון פרמטרים. בשביל להריץ אותו לא צריך כרטיס מסך ייעודי, הוא טס על כל מעבד מודרני ממוצע בענן או בשרת מקומי, ומשתלב ישירות דרך פייפליין הסיווג הסטנדרטי של ספריית transformers.

אם יש לכם שרת פייתון פעיל, עדיף להחזיק אותו מקומית בזיכרון במקום לפנות ל־API חיצוני. הזמן שלוקח לטוקנייזר ולמודל לחשב קלט בודד קצר יותר מזמן התקשורת של בקשת רשת, ואין פה שיקולי עלות שוטפת מעבר לחומרה הקיימת.

from transformers import pipeline

pipe = pipeline("text-classification", model="madhurjindal/autonlp-Gibberish-Detector-492513457")
print(pipe("שלום"))

הרישיון

רישיון MIT מלא. אפשר לקחת את הקבצים, להטמיע במוצר מסחרי, לשנות את הקוד ולהריץ בכל תשתית בלי לשלם תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים של היוצר המקורי בחבילת ההפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗