GPT
J

JudgeLM-100K

קוד פתוח

BAAIcc-by-nc-4.02023-10-27

  • instruction-finetuning

מאגר שמכיל מאה אלף דוגמאות שיפוט שנוצרו על ידי GPT-4 ומיועד לאימון מודלי שפה כשופטים להשוואת תשובות. הוא מתאים למי שרוצה להחליף קריאות יקרות ל־API במודל פנימי שמעריך ביצועים.

  • 285הורדות בחודש
  • 52לייקים

מה זה

המאגר כולל זוגות של תשובות שנוצרו על ידי מודלי שפה שונים עבור שאלות בסיס, לצד פסיקה מפורטת וניקוד מובנה שהופקו מ־GPT-4. כל רשומה כוללת את מזהה השאלה, גוף השאלה, שתי התשובות להשוואה, שמות המודלים שיצרו אותן ופרטי הדגימה הטכניים שלהם. חלק מהדוגמאות כוללות גם תשובת ייחוס ששימשה את המודל השופט לצורך הכרעה מדויקת יותר, יחד עם הנימוק והציון שנכתבו תחת ההנחיה הזו.

הנתונים מחולקים לאימון שכולל 99,647 רשומות, ואימות שמחולק לשתי גרסאות: 4,849 דוגמאות ללא תשובת ייחוס ו־4,942 דוגמאות שכוללות תשובת ייחוס. לפי התיעוד עלות הפקת הדאטה עמדה על כ־4,000 דולר, וכולו מבוסס על תיוג שנוצר במלואו על ידי מכונה.

מתאים ל

  • אימון מודל שופט

    כוונון מודל קוד פתוח להערכת איכות של תשובות פתוחות מול תשובות של מודלים אחרים.

  • הערכת ביצועים מונחית ייחוס

    אימון מערכות שבודקות תשובה ביחס לטקסט מקור מוגדר ומנמקות את הציון שהוענק.

  • מחקר על הטיות שופטים

    ניתוח האופן שבו מודלי שפה מקבלים החלטות השוואתיות בין טקסטים שונים.

איפה זה נופל

הטקסטים כולם באנגלית בלבד ואין במאגר נתונים בעברית, כך שהוא לא יסייע לשיפוט תשובות מקומיות. כל פסקי הדין והציונים נכתבו על ידי GPT-4, מה שאומר שהמודל שמאומן עליו יירש לחלוטין את ההטיות הפנימיות, העדפות האורך והטעויות של המודל המקורי. בנוסף, מדובר בנתונים שפורסמו באוקטובר 2023 ומשקפים ביצועים של מודלים מהתקופה הזו, ללא בדיקה או תיקוף אנושי על התוצאות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח כלי מסחרי?

לא, הרישיון המוגדר הוא cc-by-nc-4.0 שאינו מתיר שימוש מסחרי מכל סוג. מותר להשתמש בו למטרות מחקר, ניסויים פנימיים או פיתוח אקדמי בלבד. כל מודל שתאמנו על בסיס הנתונים הללו לא יוכל להימכר כשירות.

האם המאגר כולל דוגמאות בשפה העברית?

המאגר כולו מוגדר ומכיל טקסטים באנגלית בלבד. אם המטרה היא להעריך תשובות בעברית, הנתונים האלה לא יספקו מענה ישיר. תצטרכו לתרגם את הנתונים או ליצור סט נתונים ייעודי.

איך נוצרו הנתונים והציונים במאגר?

החוקרים אספו שאלות ותשובות ממספר מודלי שפה, והריצו עליהם את GPT-4 כשופט שתפקידו לנמק ולתת ציון. כל התהליך עלה כ־4,000 דולר והתבסס על פרומפטים מובנים, עם או בלי תשובת ייחוס. אין במאגר בדיקה ידנית של שופטים אנושיים על התיוגים.

מה ההבדל בין קבצי האימות השונים במאגר?

החלוקה נועדה לבדוק שיפוט עם ובלי תשובת מקור להשוואה. קובץ אחד מיועד למקרים שבהם המודל מעריך את התשובה באופן עיוור, והקובץ השני מספק למודל את התשובה הנכונה כעוגן. זה מאפשר לבחון את הדיוק של המודל בתרחישי בדיקה שונים.

איך טוענים

המאגר שמור כקבצי jsonl פשוטים שניתן לטעון ישירות בכל ספריית עיבוד נתונים או דרך Hugging Face ללא צורך באישור גישה מראש. הקבצים העיקריים הם קובץ האימון judgelm_train_100k.jsonl וקבצי האימות הנלווים, כולל גרסאות שמכילות את שדות ה־reference וה־score. שדות המפתח שחובה למפות הם text שמכיל את חוות הדעת המילולית של השופט ו־score שמחזיק את הציון.

from datasets import load_dataset

ds = load_dataset("BAAI/JudgeLM-100K")

הרישיון

הרישיון הוא cc-by-nc-4.0 שמיועד לשימוש מחקרי ולא מסחרי בלבד, עם חובת ייחוס ליוצרים. אסור לשלב את הנתונים ישירות במוצר שמייצר הכנסות, וכל מודל שאומן על המאגר הזה כפוף למגבלות איסור השימוש המסחרי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗