GPT
P

ptb_text_only

קוד פתוח

ptb-text-onlyother2022-03-02

גרסת טקסט נקי של פן טריבנק מיועדת בעיקר למדידת מודלי שפה על בנצ'מרק היסטורי. הטקסט מעובד מראש עם החלפת מילים נדירות ומספרים בטוקנים ייעודיים.

  • 22,942הורדות בחודש
  • 20לייקים

מה זה

המאגר מכיל מיליון מילים מתוך כתבות של הוול סטריט ג'ורנל משנת 1989, בגרסה שמקורה בפרויקט Penn Treebank Release 2. בשונה מגרסאות שכוללות תיוגי תחביר ועצי גזירה, כאן מדובר בטקסט בלבד שמיועד לאימון והערכה של מודלי שפה קלאסיים.

הטקסט עבר עיבוד אגרסיבי מראש. מילים נדירות הוחלפו במחרוזת unk, וכל המספרים הוחלפו במחרוזת N. המקורות נמשכים ישירות מקובצי טקסט של אימון, תיקוף ובדיקה ממאגר גיטהאב ישן, כפי שהיה נהוג בניסויי מודלי שפה מבוססי רשתות חוזרות.

מבנה הנתונים פשוט מאוד ומכיל רצפי טקסט באנגלית אמריקאית. הכרטיס עצמו דל בפרטים לגבי שדות ספציפיים וחלוקה סטטיסטית, אך מדובר בחלוקה המקובלת של רכבת, ולידציה ומבחן שמבוססת על המאמר המקורי מ־1993.

מתאים ל

  • בנצ'מרק של מודלי שפה

    השוואת ביצועי Perplexity מול מאמרים קלאסיים בתחום מודלי השפה.

  • מחקר והוראה אקדמית

    הדגמת אימון מודלי רשתות חוזרות על קורפוס קטן ומעובד מראש.

  • בדיקת ארכיטקטורות קטנות

    הרצת בדיקות היתכנות מהירות שאינן דורשות משאבי חישוב כבדים.

איפה זה נופל

הטקסט כולו נאסף מעיתונות כלכלית אמריקאית משנת 1989, מה שאומר שהשפה ישנה, מוגבלת לתחום העסקי ורוויה בהטיות של עולם העיתונות של אותה תקופה. אין כאן עברית בכלל, ואין ביטוי לסלנג, שיח מודרני או נושאים טכנולוגיים עדכניים. בנוסף, ההחלפה של כל המספרים והמילים הנדירות בטוקנים הופכת את המאגר לבלתי שמיש לחלוטין עבור משימות פרודקשן מודרניות, שבהן המודל נדרש להבין מספרים או שמות עצם ייחודיים.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

לא. הרישיון מוגדר למטרות מחקר בלבד, והמקור הוא קורפוס תחת זכויות של ארגון LDC. אימון מודל לצורך מסחרי מפר את תנאי השימוש.

האם יש במאגר טקסטים בעברית?

לא, המאגר כולו באנגלית אמריקאית בלבד. הטקסטים נלקחו ישירות מעיתון הוול סטריט ג'ורנל בסוף שנות השמונים.

מה ההבדל בין מאגר זה ל־Penn Treebank המקורי?

הגרסה הזו מכילה טקסט פשוט בלבד ללא עצי תחביר, תיוגי חלקי דיבר או מבנים דקדוקיים. בנוסף, בוצע בו עיבוד שמחק מספרים ומילים נדירות לטובת מודלי שפה.

כמה נפח דורשת הורדת המאגר?

המאגר שוקל מגה בייטים בודדים בלבד. הוא כולל בסך הכל כמיליון מילים ומספר קובצי טקסט פשוטים.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה באמצעות המזהה שלו, ללא צורך בבקשת גישה מיוחדת או אישור ידני. הקוד מושך שלושה קובצי טקסט מגיטהאב, כך שמדובר בנפח זעיר של כמה מגה בייטים בודדים. השדה המרכזי הוא הטקסט עצמו, והוא כבר כולל את הטוקנים המיוחדים למספרים ומילים חסרות, כך שאין צורך בניקוי נוסף לפני הרצה במודל.

from datasets import load_dataset

ds = load_dataset("ptb-text-only/ptb_text_only")

הרישיון

הרישיון מוגדר כ־other והכרטיס מציין במפורש שהחומר ניתן למטרות מחקר בלבד. השימוש המסחרי אסור, ואי אפשר להשתמש במודל שאומן עליו בתוך מוצר מסחרי. כדי להשתמש בנתונים המקוריים נדרש רישיון של ה־LDC.

הרישיון המלא ב־Hugging Face ↗