GPT
H

Human-Like-DPO-Dataset

קוד פתוח

HumanLLMsllama32024-05-19

המאגר מרכז זוגות של תשובות אנושיות מול תשובות רשמיות לאימון העדפה. הוא נבנה כדי לגמול מודלים מסגנון דיבור רובוטי ויבש.

  • 744הורדות בחודש
  • 260לייקים

מה זה

המאגר מכיל 10,884 דוגמאות שמחולקות ל־256 נושאים שונים, ביניהם טכנולוגיה, חיי יום יום, מדע, היסטוריה ואמנות. המבנה מיועד ישירות לאימון העדפה מסוג DPO, כך שכל רשומה כוללת שאלה מתוך שיחה טבעית ושתי חלופות של מענה.

החלופה האחת היא תגובה שנכתבה בסגנון אנושי וזורם, והשנייה היא תגובה רשמית ומובנית שמזכירה את הפלט האופייני של מודלי שפה רגילים. לפי שמות הקבצים במאגר, הנתונים חולקו לכמה קובצי JSON לפי תאריכי יצירה וסגנונות שיחה, כולל דוגמאות שנוצרו בעזרת Llama 3 405B, אך הכרטיס אינו מפרט תהליך סינון ידני או אוטומטי מעבר לכך.

מתאים ל

  • אימון העדפה למודלי שיחה

    כוונון מודלים בשיטת DPO כדי להפחית ניסוחים נוקשים ולהפוך את סגנון הדיבור לקליל וטבעי.

  • הערכת סגנון פלט

    בדיקה השוואתית האם מודל שפה קיים נוטה לתשובות רובוטיות מול תשובות שיחתיות בנושאים כלליים.

  • בניית סוכני שירות אישיים

    אימון בוטים שמיועדים לנהל שיחת חולין יומיומית ולא לספק תשובות אנציקלופדיות יבשות.

איפה זה נופל

המאגר מוגדר כולו באנגלית ואין בו נתונים בעברית בכלל. שמות הקבצים חושפים שימוש במודל Llama 3 405B ליצירת השאלות או התשובות, מה שאומר שהתשובות האנושיות הן למעשה חיקוי סינתטי של דיבור אנושי ולא שיחות שנאספו מבני אדם אמיתיים. הכרטיס לא מציין בדיקות בטיחות, סינון רעלים או הטיות שבוצעו על הטקסט, ולכן חובה לסנן את התוכן לפני שמכניסים אותו לתהליך אימון של מודל שמיועד לשירות משתמשים.

שאלות
נפוצות

האם המאגר מתאים לאימון מודלים בעברית?

לא. המאגר מוגדר באנגלית בלבד וכולל טקסטים באנגלית. כדי להשתמש בו למודל עברי תצטרכו לתרגם את כל הדוגמאות, תהליך שעלול לאבד את הסגנון השיחתי הטבעי שמנסים להשיג כאן.

האם מותר להשתמש בדאטהסט למוצר מסחרי?

הרישיון המדווח הוא llama3 של מטא שמאפשר שימוש מסחרי, אך הוא כולל מגבלות ספציפיות על היקף משתמשים ועל אופן השימוש בפלטים. מומלץ לקרוא את תנאי השימוש של Llama 3 לפני שילוב שלו במוצר מסחרי.

איך הנתונים נאספו ונבנו בפועל?

הכרטיס עצמו לא מפרט את תהליך האיסוף המלא ומפנה למאמר אקדמי, אך שמות הקבצים במאגר מראים שחלק מהמידע נוצר בעזרת Llama 3 405B. מדובר בדאטה סינתטי שמכוון לייצר שאלות טבעיות ותשובות שמחקות דיבור אנושי מול תשובות רובוטיות.

איזה מבנה נתונים מקבלים כשמורידים את הקבצים?

במאגר ישנם 14 קבצים, בעיקר קובצי JSON נפרדים כמו קובץ ממוזג וקבצים לפי תאריכים. כל רשומה בנויה סביב נושא מתוך 256 נושאים, וכוללת שאלה, תשובה בסגנון אנושי ותשובה בסגנון רשמי שמשמשות כזוג להעדפה.

איך טוענים

הנתונים יושבים בפורמט JSON ישירות במאגר של Hugging Face, ללא דרישה לאישור גישה מוקדם. יש שם 14 קבצים שונים, כולל קבצים מפוצלים לפי תאריכים כמו ספטמבר 2024 וקובץ ממוזג. כדי להריץ אימון DPO צריך לשים לב לשלושת השדות המרכזיים בכל רשומה: שאלת השיחה, התשובה האנושית שמשמשת בתור התשובה המועדפת, והתשובה הרשמית שמשמשת בתור התשובה הדחויה.

from datasets import load_dataset

ds = load_dataset("HumanLLMs/Human-Like-DPO-Dataset")

הרישיון

הרישיון המדווח הוא llama3 של חברת מטא. הרישיון הזה מתיר שימוש מסחרי ומחקר, אך כפוף למגבלות השימוש המקובלות של מטא, כולל הגבלת משתמשים חודשיים ומגבלות על אימון מודלים מתחרים מסוימים. יש לבדוק את תנאי הרישיון של Llama 3 כדי לוודא שהמודל שאתם מאמנים עומד בכל הדרישות.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗