GPT
T

t5-base-question-generator

קוד פתוח

iarfmooseרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • t5

המודל הזה מקבל טקסט ותשובה, ומייצר מתוכם שאלת הבנת הנקרא מתאימה. הוא מתאים למי שרוצה לייצר שאלונים אוטומטית מטקסט קיים בלי להסתמך על מודלי ענק יקרים.

  • 512טוקנים בהקשר
  • 2.5 GBמשקל הקבצים
  • 195,113הורדות בחודש
  • 63לייקים

מה זה

במקום לענות על שאלות, המודל הזה עובד הפוך. מדובר בגרסה מכווננת של t5-base שאומנה על בערך 200,000 דוגמאות מתוך מאגרי שאלות ותשובות מוכרים כמו SQuAD, CoQA ו־MSMARCO. מזינים לו תשובה והקשר בפורמט מוגדר עם תגיות, והוא מחזיר שאלה שלמה שמכוונת לאותה תשובה בדיוק.

הוא עובד הכי טוב כשהתשובה שמוזנת אליו היא משפט מלא, אבל הוא יודע להתמודד גם עם מילה בודדת או ביטוי קצר. התוצאה היא שאלות קלאסיות של מבחני קריאה, בדיוק באותו סגנון של מערכי הנתונים שמהם הוא למד.

מתאים ל

  • מחולל שאלונים ללמידה

    יצירת מבחני הבנת הנקרא מתוך פסקאות קצרות ותשובות נבחרות.

  • העשרת נתונים לאימון

    ייצור אוטומטי של זוגות שאלה ותשובה מטקסטים קיימים לטובת דאטה-סטים.

  • כרטיסיות לימוד עצמי

    הפיכת סיכומי שיעור באנגלית לשאלות תרגול ממוקדות לפי משפטי מפתח.

איפה זה נופל

חלון ההקשר קצר מאוד ועומד על 512 טוקנים בלבד, כולל התשובה והטקסט יחד. זה אומר שאי אפשר לתת לו פסקאות ארוכות, ועברית תתפוס פה כמות טוקנים גדולה במיוחד בגלל הטוקנייזר. חוץ מזה, אם ההקשר קצר מדי, חסר, או לא תואם לתשובה שהגדרתם, המודל פשוט מייצר שאלות לא קוהרנטיות. הוא גם נוטה לייצר שאלות מוטות שמובילות לתשובה ומעתיק הטיות ישירות מתוך הטקסט.

שאלות
נפוצות

האם המודל מתאים לייצור שאלות מטקסטים בעברית?

לא מומלץ לבנות על זה. המודל אומן על מאגרים באנגלית בלבד כמו SQuAD ו־MSMARCO. מעבר לזה, הטוקנייזר המקורי של T5 חותך עברית לחתיכות קטנות מאוד, מה שיגמור את מכסת 512 הטוקנים עוד לפני שתספיקו להכניס פסקה סבירה.

למה צריך מודל נוסף כדי לסנן את השאלות?

היוצר מציין במפורש שהתוצאות הטובות ביותר מתקבלות כשמייצרים כמה שאלות במקביל ומסננים אותן עם מודל הערכה ייעודי. מודל T5 הבסיסי הזה עשוי לפלוט שאלות עילגות או כאלה שלא ממש מובילות לתשובה, ולכן כדאי להוסיף שלב אימות אם מייצרים תוכן בלי מגע יד אדם.

איך מריצים

המודל שוקל 2.5 גיגה בייט ומבוסס על ספריית transformers הסטנדרטית בארכיטקטורת T5ForConditionalGeneration. אפשר להריץ אותו בלי בעיה על מעבד רגיל, ובכרטיס מסך בסיסי עם כמה גיגה בייטים של זיכרון הוא יעבוד מהר מאוד. הקלט מחייב שרשור של התשובה והטקסט עם תגיות ייעודיות לפני שליחה לפונקציית הייצור.

מי שרוצה איכות גבוהה יצטרך לייצר כמה שאלות במקביל ולסנן אותן עם מודל הערכה נפרד שהיוצר מציע. אם אתם צריכים שאלות ספורות מדי פעם או שהטקסטים שלכם ארוכים מחצי עמוד, קריאה ל־API חיצוני תחסוך לכם את הצורך לקצוץ טקסטים ולנהל שני מודלים במקביל.

from transformers import pipeline

pipe = pipeline("text-generation", model="iarfmoose/t5-base-question-generator")
print(pipe("שלום"))

הרישיון

היוצר לא הגדיר רישיון שימוש לקבצי המודל. מבחינה משפטית, היעדר רישיון אומר שאין לכם הרשאה מפורשת להשתמש בו, להפיץ אותו או לשלב אותו במוצר מסחרי. לחברות שדורשות עמידה בתקני קוד פתוח לא מומלץ להכניס אותו לסביבת ייצור בלי לבדוק קודם מול המפתח.

הרישיון המלא בעמוד המודל ↗