GPT
O

oasst2

קוד פתוח

OpenAssistantapache-2.02023-12-24

  • human-feedback

שיחות אנושיות במבנה עץ שנועדו לאימון מודלי שיחה, עם סימון תפקידים ברור בין משתמש לעוזר. הדאטהסט מרכז מידע שנאסף ממשתמשים אמיתיים ומציע חלופות תגובה לכל שלב בשיחה.

  • 14,289הורדות בחודש
  • 301לייקים

מה זה

הנתונים נאספו ישירות ממשתמשי האתר של הפרויקט עד נובמבר 2023, כשהמשתתפים מייצרים גם את השאלות וגם את התשובות. כל רשומה מייצגת עץ שיחה שמתחיל בהודעת פתיחה, ומתפצל לתגובות שונות שמתחלפות לסירוגין בין משתמש לעוזר. המבנה הזה מאפשר לראות כמה תשובות אפשריות לאותה הפנייה בדיוק.

המאגר מציע קבצים במבנה שטוח של הודעות בודדות או במבנה היררכי מלא של עצים. גרסת הבסיס המוכנה לאימון מכילה 13,854 עצים ובהם 135,174 הודעות שעברו סינון ידני ובדיקות רעילות, מתוכן נמחקו הודעות פגומות או ספאם. לצד אלה קיימים קבצים עם כלל השיחות שנאספו, כולל שיחות שנעצרו בגלל איכות נמוכה, קובץ ייעודי לספאם וקובץ של פניות פתיחה בלבד.

מתאים ל

  • אימון מודלי שיחה בסגנון SFT

    אימון ראשוני של מודלי שפה על שרשורי שיחה מרובי שלבים שבהם מוגדרים תפקידי משתמש ועוזר.

  • אימון מודלי תגמול והעדפה

    שימוש בפיצולים של עצי השיחה, שבהם מספר תגובות לאותה הודעה, כדי לדרג איכות תשובות עבור RLHF.

  • בדיקת וסינון תוכן פוגעני

    ניתוח מעל 111,000 הודעות שמכילות דירוגי רעילות לצורך בנייה או הערכה של מסנני בטיחות.

איפה זה נופל

האיסוף הסתמך על מתנדבים באתר, ולכן הנתונים מייצגים רק את מי שבחר להשתתף בפרויקט עד סוף שנת 2023. רוב החומר כתוב באנגלית עם 64,513 הודעות, ובספרדית עם 28,199 הודעות. ישראלים שמחפשים תוכן מקומי יגלו שהשפה העברית זניחה לחלוטין עם 24 הודעות בלבד בכל המאגר המסונן. בנוסף, אלפי הודעות נפסלו בגלל תיוג שפה שגוי או איכות ירודה, כך שחובה לסנן את המידע שוב לפני שמזינים אותו לאימון של מודל המיועד לשימוש אמיתי.

שאלות
נפוצות

האם הדאטהסט כולל תוכן בעברית?

הקובץ המסונן כולל 24 הודעות בלבד בעברית. זה לא מספיק כדי לאמן או להעריך מודל בעברית, ולמעשה הכיסוי של השפה כמעט אפסי.

האם מותר להשתמש בנתונים כדי לאמן מוצר מסחרי?

כן, רישיון Apache 2.0 מאפשר שימוש מסחרי מלא באימון מודלים ובפיתוח מוצרים. הדרישה העיקרית היא הוספת הקרדיט ועותק של הרישיון בעת הפצת הנתונים.

איך נאספו השיחות שבמאגר?

הטקסט נאסף דרך אתר אינטרנט ציבורי שבו מתנדבים כתבו שאלות, סיפקו תשובות ודירגו איכות של הודעות. התהליך כלל סינון של הודעות ספאם ובדיקות רעילות ממוחשבות.

באיזה פורמט כדאי להוריד את הנתונים?

לטעינה מהירה בספריית פייתון מומלץ להשתמש בפורמט פרקט המובנה דרך Hugging Face. אם רוצים לחקור את מבנה העץ המלא וההסתעפויות שלו, עדיף להוריד ישירות את קובצי ה־JSONL הדחוסים שמכילים את העצים.

איך טוענים

טוענים את הגרסה המסוננת ישירות דרך ספריית datasets עם השם OpenAssistant/oasst2, שמחזירה חלוקה מובנית לסט אימון של 128,575 הודעות וסט ולידציה של 6,599 הודעות בפורמט פרקט. המאגר פתוח לציבור ואין צורך לבקש אישור גישה מראש. אם עובדים עם הטבלה השטוחה ורוצים לשחזר את מבנה השיחה המקורי, משתמשים במזהים parent_id ו־message_id כדי לקשר בין תגובה להודעה שקדמה לה.

from datasets import load_dataset

ds = load_dataset("OpenAssistant/oasst2")

הרישיון

הרישיון הוא Apache 2.0, והוא מתיר שימוש מסחרי חופשי, שינוי של הקוד והנתונים, והפצה מחדש. אין דרישה לשתף תוצרים או מודלים מאומנים תחת אותו הרישיון, אך יש חובה לשמור על הודעת זכויות היוצרים והרישיון המקורי בכל הפצה של הנתונים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗