GPT
W

webgpt_comparisons

קוד פתוח

openaiרישיון לא דווח2022-12-18

openai עומדים גם מאחורי Sora, ויש עליו סקירה כאן.

המאגר מרכז 19,578 השוואות בין תשובות מודל לשאלות פתוחות, לצד העדפות אנושיות וציטוטים מהרשת. מי שמפתח מודלי תגמול או חיפוש מקבל כאן הצצה ישירה לאופן שבו OpenAI אימנו מודל להסתמך על מקורות.

  • 915הורדות בחודש
  • 241לייקים

מה זה

כל רשומה מייצגת שאלה אחת וזוג תשובות מתחרות, answer_0 ו־answer_1, שנוצרו בסיוע גלישה ברשת. לצד התשובות תמצאו את הציטוטים שנאספו בזמן הגלישה כולל שמות הדומיינים וכותרות העמודים, את הטוקנים המוכנים לטוקנייזר של GPT-2, וציוני העדפה אנושיים שנעים בין מינוס אחד לאחד.

הנתונים נאספו במסגרת פרויקט WebGPT של OpenAI כדי לחנך מודל מענה ארוך על שאלות. החוקרים סיננו את המידע ושמרו רק השוואות שסומנו כמתאימות לאימון מודל תגמול עד לסיום הפרויקט. הניקוד האנושי מסתכם תמיד לאפס בין שני הצדדים, כך שציון חיובי מצביע על התשובה המועדפת, בעוד ציון אפס נחשב להעדפה שווה של 50%.

מתאים ל

  • אימון מודל תגמול

    אימון Reward Model שמדרג תשובות לפי ציוני העדפה אנושיים ודיוק ההסתמכות על מקורות ברשת.

  • הערכת ציטוטים וביסוס

    בדיקה האם מודל יודע לחלץ מובאות רלוונטיות מתוך דפי אינטרנט כדי לתמוך בטענות שלו.

  • מחקר על יישור מודלים

    ניתוח מקרים שבהם בני אדם העדיפו תשובה אחת על פני אחרת בשאלות מורכבות.

איפה זה נופל

הנתונים פורסמו עוד בסוף 2021 ונשענים על עמודי רשת שנאספו באותה תקופה, לכן חלק ניכר מהעובדות או המקורות כבר לא מעודכן. הטוקניזציה המובנית מותאמת ספציפית ל־GPT-2 באנגלית, מה שהופך את הדאטהסט לחסר תועלת כמעט לחלוטין עבור משימות בעברית ללא עיבוד מחדש. בנוסף, חיתוכי הטקסט שבוצעו על הציטוטים וההסתמכות הבלעדית על המעריכים האנושיים של הפרויקט מכניסים הטיות בשיפוט שצריך לבדוק טוב לפני שמסתמכים עליהן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ כרגע. המאגר פורסם ללא הגדרת רישיון, מה שאומר שאין היתר שימוש מסחרי רשמי. ארגונים מסחריים מסתכנים בהפרת זכויות יוצרים אם יאמנו עליו מודלים פנימיים.

האם יש במאגר שאלות או תשובות בעברית?

לא. כל 19,578 ההשוואות, הציטוטים מדפי האינטרנט והטוקנים שנשמרו מבוססים על אנגלית בלבד. כדי להשתמש בו לעברית תצטרכו לתרגם את השאלות והמקורות מאפס.

איך נאספו ציוני ההעדפה של התשובות?

מעריכים אנושיים בחנו שתי תשובות שונות שהמודל יצר לכל שאלה יחד עם המקורות שהוא שלף מהרשת. כל מעריך קבע מי התשובה הטובה יותר ונתן ציון בין מינוס אחד לאחד, כאשר סכום הציונים של שתי התשובות הוא תמיד אפס.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה של Hugging Face באמצעות המזהה openai/webgpt_comparisons. המאגר מכיל שלושה קבצים, כולל סקריפט הטעינה webgpt_comparisons.py, ואין צורך לבקש אישור גישה מיוחד. כדאי לשים לב לשדות tokens_0 ו־tokens_1 שכבר כוללים שרשור מוכן של השאלה, הציטוטים והתשובה בפורמט GPT-2, לצד שדות הציון score_0 ו־score_1 שמגדירים את מטרת האימון.

from datasets import load_dataset

ds = load_dataset("openai/webgpt_comparisons")

הרישיון

בעמוד המאגר לא דווח רישיון כלל. מבחינה משפטית, היעדר רישיון מפורש אומר שכל הזכויות שמורות ואין הרשאה ברורה להשתמש בנתונים לפיתוח מסחרי או לאימון מודלים שמיועדים להפצה. אם אתם בונים מוצר מסחרי, לא הייתי נוגע בזה בלי בדיקה משפטית מול הגורמים שפרסמו את המחקר.

הרישיון המלא ב־Hugging Face ↗