GPT
T

T5_Paraphrase_Paws

קוד פתוח

Vamsiרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

המודל הזה משכתב משפטים באנגלית ומייצר להם ניסוחים חלופיים. מי שצריך לגוון טקסטים או להרחיב דאטה בלי להרים שרת ענק ימצא בו פתרון ממוקד.

  • 223Mפרמטרים
  • 512טוקנים בהקשר
  • 5.8 GBמשקל הקבצים
  • 82,552הורדות בחודש

מה זה

מדובר בהתאמה של T5 שמיועדת למשימה אחת בלבד, ניסוח מחדש של משפטים באנגלית. הוא אומן על גבי דאטה-סט PAWS של גוגל, שמכיל זוגות משפטים עם חפיפה מילולית גבוהה אבל משמעויות שלפעמים זהות ולפעמים שונות לחלוטין. בגלל הדאטה הזה, הוא יודע לשנות מבנה תחבירי בלי להחליף מילים באופן עיוור.

עם 223 מיליון פרמטרים הוא שייך לקטגוריית המשקל הקל, מה שאומר שהוא לא מנסה להתחרות במודלים כלליים ענקיים. היתרון שלו הוא בפוקוס המוחלט על פראפרייזינג באנגלית. הוא מקבל משפט עם תחילית קבועה ופולט כמה וריאציות שונות של אותו רעיון, בלי לנסות לענות על שאלות, לסכם או להמציא מידע חדש שלא היה בקלט המקורי.

מתאים ל

  • אוגמנטציה לטקסט באנגלית

    יצירת גרסאות מגוונות של משפטים כדי להרחיב מאגרי אימון למודלים אחרים.

  • גיוון תשובות לבוטים

    ניסוח מחדש של הודעות מערכת קבועות כדי שהשיחה באנגלית לא תישמע רובוטית.

  • שיפור ניסוח למשתמשים

    הצעת חלופות קריאות וברורות יותר למשפטים באנגלית בתוך כלי כתיבה ועריכה.

איפה זה נופל

הוא מוגבל לאנגלית בלבד, כך שלעברית אין מה לנסות אותו בכלל. חלון ההקשר שלו מוגבל ל־512 טוקנים והוא מיועד למשפטים בודדים, לא לפסקאות שלמות או למאמרים. אם תזרקו עליו טקסט ארוך הוא פשוט יחתוך אותו או יאבד את המבנה. בנוסף, הדאטה-סט PAWS מתמקד בהבדלים דקים בין משפטים דומים, מה שלפעמים גורם לו לייצר שינויים קטנים מדי במקום ניסוח חדש לחלוטין. לפני שילוב שלו במוצר צריך לבדוק שהוא לא משנה את המשמעות של עובדות או שולף שגיאות תחביר.

שאלות
נפוצות

אפשר להשתמש בו לטקסטים בעברית?

לא. המודל אומן על אנגלית בלבד ולא מזהה עברית. הרצה של טקסט עברי תניב פלט שבור לחלוטין.

הוא מסוגל לשכתב פסקאות שלמות?

לא מומלץ. הארכיטקטורה והאימון שלו מבוססים על משפטים בודדים, וחלון ההקשר מוגבל ל־512 טוקנים. פסקאות ארוכות יאבדו קוהרנטיות.

איך מריצים

כדי להריץ אותו צריך להתקין את transformers ואת sentencepiece. הקוד דורש הוספת התחילית paraphrase לפני המשפט וטוקן סיום, ואז הרצת פעולת generate סטנדרטית שתומכת ב־PyTorch או ב־TensorFlow. הדוגמה הרשמית מציגה שליפה של חמש וריאציות במקביל באמצעות דגימה עם top-k ו־top-p.

משקל הקבצים עומד על 5.8 גיגה-בייט, כך שהוא ירוץ בלי בעיה על כרטיס מסך בסיסי או אפילו על מעבד רגיל אם זמן התגובה פחות לוחץ. שווה להרים אותו לבד רק אם יש לכם צורך בעיבוד מקומי, פרטיות מלאה או שכתוב באצוות גדולות, אחרת קריאה למודל כללי דרך API פשוט חוסכת את הניהול שלו.

from transformers import pipeline

pipe = pipeline("text-generation", model="Vamsi/T5_Paraphrase_Paws")
print(pipe("שלום"))

הרישיון

היוצר לא פרסם רישיון בעמוד המודל. מבחינה משפטית, היעדר רישיון אומר שאין לכם היתר מפורש להשתמש בו, להפיץ אותו או להטמיע אותו במוצר מסחרי. מי שבוחר להריץ אותו בפרודקשן של חברה לוקח סיכון של הפרת זכויות יוצרים, ועדיף לפנות ליוצר או לחפש חלופה עם רישיון פתוח וברור.

הרישיון המלא בעמוד המודל ↗