GPT
S

summarize_from_feedback

קוד פתוח

openaiרישיון לא דווח2022-12-28

openai עומדים גם מאחורי Sora, ויש עליו סקירה כאן.

המאגר כולל פידבק אנושי להשוואת סיכומים ודירוג איכותם. הוא מיועד למי שבונה או מאמן מודל תגמול כדי להתאים סיכומי טקסט להעדפות של אנשים.

  • 2,362הורדות בחודש
  • 220לייקים

מה זה

הנתונים מבוססים על המאמר של החוקרים מ־2020 ומחולקים לשני חלקים עיקריים לפי סוג המשימה שהמעריכים קיבלו. החלק הראשון נקרא comparisons ומכיל השוואות שבהן בודקים אנושיים בחרו את הסיכום הטוב יותר מבין שני סיכומים מוצעים. החלק הזה כולל רק חלוקות לאימון ולוולידציה.

החלק השני נקרא axis וכולל ציונים שנתנו מעריכים על גבי סולם ליקרט כדי למדוד איכות של סיכום, כשהוא מחולק רק לסט בדיקה וסט ולידציה. הסיכומים ששימשו לאימון מודל התגמול נלקחו ממאגר TL;DR, ודאטה נוסף לבדיקה ולוולידציה נאסף גם מכתבות של CNN ו־Daily Mail.

מתאים ל

  • אימון מודל תגמול

    שימוש בהשוואות הזוגיות מתוך comparisons כדי לאמן מודל שמדרג סיכומים לפי העדפת אדם.

  • הערכת איכות סיכומים

    בדיקת ביצועי סיכום מול ציוני ליקרט אנושיים שניתנו בסט הבדיקה של axis.

  • מחקר על יישור מודלים

    שחזור ניסויי יישור והשוואת אלגוריתמים לאימון מפידבק אנושי על דאטה ידוע מהספרות.

איפה זה נופל

המקורות לטקסטים מוגבלים לאנגלית של רשת Reddit דרך TL;DR ולאתרי חדשות ספציפיים כמו CNN ו־Daily Mail. אם המטרה היא סיכום בעברית או טקסטים טכניים ומקצועיים, ההעדפות שנלמדו כאן לא מייצגות. בנוסף, חלוקת הנתונים לא סימטרית, אין סט בדיקה להשוואות הזוגיות ואין סט אימון לציוני האיכות, מה שמגביל את אופן השימוש בכל חלק.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

אין רישיון מוגדר בעמוד המאגר. ללא תנאי רישיון מפורשים, שימוש מסחרי כרוך בסיכון משפטי ואינו מומלץ לחברות שדורשות כיסוי מלא של זכויות יוצרים.

האם המאגר כולל תוכן בעברית?

לא. המקורות המפורטים בכרטיס הם TL;DR, CNN ו־Daily Mail, שכולם באנגלית בלבד.

מאיפה נאסף הפידבק ומה הוא כולל?

הפידבק נאסף ממעריכים אנושיים במסגרת מחקר של אנשי OpenAI. הוא כולל בחירה בין שני סיכומים מתחרים וציוני איכות בסולם ליקרט לסיכומים שנכתבו על מאמרים ופוסטים.

למה אי אפשר לאמן מודל ישירות על חלק ה־axis?

לפי הכרטיס, חלק ה־axis כולל רק סטים של ולידציה ובדיקה ללא סט אימון. מי שמחפש נתוני אימון צריך לפנות לחלק ה־comparisons, שבו קיימת חלוקת train.

איך טוענים

טוענים את המאגר ישירות בעזרת הספרייה datasets דרך המזהה של המאגר, יחד עם סקריפט הטעינה summarize_from_feedback.py שמגיע איתו. אין צורך באישור גישה מיוחד כדי להוריד את הקבצים. לפני שמתחילים כדאי לשים לב שצריך לבחור איזו תצורה מושכים, את comparisons להעדפה זוגית או את axis לציונים רציפים, משום שהמבנה והחלוקות לסטים שונים ביניהם.

from datasets import load_dataset

ds = load_dataset("openai/summarize_from_feedback")

הרישיון

הרישיון לא דווח במאגר. במצב כזה אין אישור מפורש לשימוש מסחרי, ואי אפשר לדעת מה המגבלות על מודלים שמאמנים עליו. מפתח שרוצה לשלב את המאגר במוצר מסחרי צריך לקחת בחשבון שמבחינה משפטית השימוש אינו מוסדר.

הרישיון המלא ב־Hugging Face ↗