GPT
T

tldr

קוד פתוח

trl-libרישיון לא דווח2024-08-22

  • trl

פוסטים מרדיט לצד הסיכומים שהכותבים עצמם ניסחו בסוף הטקסט תחת הכותרת המוכרת. אם אתם בונים מודל תמצות בעזרת ספריית TRL, המבנה מותאם בדיוק למשימה הזו.

  • 6,815הורדות בחודש
  • 31לייקים

מה זה

המאגר מבוסס על תופעה רגילה ברדיט שבה משתמשים מוסיפים תקציר בשורה אחת בסוף פוסט ארוך. הצוות לקח את הפוסטים המקוריים, חילץ מהם את פסקת הסיכום והפך אותם לצמדים ישירים של קלט ופלט שמיועדים לאימון מודלים של שפה.

בפנים יש שתי עמודות עיקריות. העמודה הראשונה נקראת pompt, כולל שגיאת הכתיב במקור, והיא מכילה את גוף הפוסט המלא ללא עריכה. העמודה השנייה נקראת completion והיא מכילה את הסיכום הקצר שכתב המחבר המקורי ברשת. הנתונים מחולקים מראש לקובצי אימון, ולידציה ובדיקה בפורמט פרקט, כך שאין צורך לפצל אותם ידנית לפני שמתחילים לעבוד.

כל התהליך נשען על סקריפט עיבוד שמפורסם בריפו של TRL, אבל הכרטיס לא מפרט אילו סינונים הופעלו על הטקסטים בדרך, האם הוסרו פוסטים פוגעניים, או באילו תאריכים הפוסטים האלה נאספו מרדיט.

מתאים ל

  • אימון מודלים לתמצות

    לימוד מודל שפה לייצר תקציר קצר מתוך טקסט ארוך ולא רשמי בסגנון דיבור חופשי.

  • עבודה עם ספריית TRL

    בדיקת סקריפטים של prompt-completion בתוך סביבת TRL בלי לבצע המרות מבנה.

  • הערכת ביצועי סיכום

    מדידת יכולת המודל לתמצת פוסטים באמצעות קובצי הבדיקה והוולידציה המוכנים.

איפה זה נופל

הטקסטים מגיעים מרדיט, מה שאומר אנגלית בלבד, סלנג אינטרנטי כבד, כתיבה לא רשמית והרבה מאוד רעש שלא מתאים למסמכים מקצועיים. המאגר לא מדווח על סינון של שפה בוטה, מידע אישי או תוכן רעיל, כך שהכנסה שלו ישר למודל בלי בדיקה ידנית של הדוגמאות מסוכנת. בנוסף, לא ידוע מאילו שנים הפוסטים נלקחו, כך שאי אפשר לדעת מראש כמה המידע שם מיושן.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מסחרי?

לא מומלץ בכלל. לא דווח רישיון עבור המאגר הזה, וזכויות היוצרים על הפוסטים שייכות למשתמשי רדיט. שימוש מסחרי במצב כזה הוא סיכון משפטי ברור.

האם הדאטהסט כולל טקסטים בעברית?

לא. מדובר בפוסטים שנאספו מקהילות ברדיט, וכל התוכן שם כתוב באנגלית בלבד. אם אתם צריכים לאמן מודל בעברית, המאגר הזה לא רלוונטי.

איך הנתונים נאספו ועובדו?

הנתונים חולצו מפוסטים ברדיט שכללו פסקת סיכום שהמשתמש הוסיף לעצמו. העיבוד התבצע באמצעות סקריפט פתוח של צוות TRL, אבל מעבר לכך לא פורטו קריטריונים לסינון תוכן.

מה שונה במבנה של המאגר הזה ממאגרי טקסט רגילים?

הוא מוגדר מראש בפורמט prompt-completion של TRL ומחולק מראש לאימון, ולידציה ובדיקה. רק שימו לב ששם עמודת הקלט במאגר מכיל שגיאת כתיב ונקרא pompt.

איך טוענים

טוענים אותו ישירות דרך ספריית datasets באמצעות הנתיב trl-lib/tldr בלי שום צורך לבקש אישור גישה מראש. הנתונים שמורים בקובצי פרקט ומחולקים לסטים של train, validation ו־test. שימו לב כשאתם כותבים את קוד האימון שהעמודה שכוללת את הפוסט המלא נקראת pompt בגלל תקלדת במאגר, ולא prompt, כך שאם לא תפנו לשם המדויק הזה הטעינה תיכשל.

from datasets import load_dataset

ds = load_dataset("trl-lib/tldr")

הרישיון

המאגר עלה בלי דיווח על רישיון כלל, מה שאומר שמבחינה משפטית אין לכם היתר מפורש להשתמש בו, בטח שלא במוצר מסחרי. מעבר לזה, הטקסטים שייכים לגולשים ברדיט, ולכן אימון מודל על המידע הזה חושף אתכם לסיכוני זכויות יוצרים שאי אפשר לגדר כרגע.

הרישיון המלא ב־Hugging Face ↗