GPT
O

oasst1

קוד פתוח

OpenAssistantapache-2.02023-04-13

  • human-feedback

שיחות אמיתיות שנכתבו ודורגו בידי בני אדם במבנה עץ. מתאים בעיקר לאימון מודלי שיחה ודירוג תגובות בלי להסתמך על נתונים סינתטיים.

  • 30,920הורדות בחודש
  • 1,567לייקים

מה זה

המאגר מכיל 161,443 הודעות ב־35 שפות שנאספו מיותר מ־13,500 מתנדבים דרך פלטפורמת הרשת של הפרויקט, לצד 461,292 דירוגי איכות. המבנה אינו רשימה ליניארית אלא עצי שיחה: כל עץ מתחיל בהנחיה ראשית, וממנה מסתעפות תגובות של עוזר ומשתמש לסירוגין.

הנתונים מחולקים למספר קבצים. הקובץ המרכזי המוכן לעבודה כולל 10,364 עצים מסוננים עם 88,838 הודעות נקיות מספאם, תיוגים ואיכות מאומתת. קובץ העצים המלא כולל 66,497 עצים, שבהם גם שיחות שנעצרו בגלל איכות ירודה, עצים עם הנחיה בלבד או כאלה שנחסמו בידי מנהלים. בנוסף קיימים קבצים נפרדים להודעות ספאם והנחיות בודדות.

מתאים ל

  • אימון SFT למודלי שיחה

    שימוש בעצי השיחה המוכנים כדי ללמד מודל בסיס לענות כעוזר מועיל.

  • אימון מודלי תגמול RM

    ניצול מאות אלפי דירוגי האיכות האנושיים להערכת איכות תשובות.

  • סינון וזיהוי ספאם

    אימון מסננים על בסיס קובץ הספאם וההודעות שנפסלו בבקרת איכות.

איפה זה נופל

האיסוף הסתמך כולו על מתנדבים ברשת עד אפריל 2023, ולכן הסגנון והאיכות משתנים מאוד בין כותבים שונים. בנוסף, חלוקת השפות מוטה בצורה קיצונית: אנגלית וספרדית מרכיבות את הרוב המוחלט עם מעל 115 אלף הודעות יחד. עברית כמעט לא קיימת שם עם 255 הודעות בלבד, כך שלאימון מודל מקומי בעברית אין למאגר הזה ערך ממשי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא Apache 2.0 והוא מתיר שימוש מסחרי חופשי לחלוטין. מותר לאמן עליו מודלים מסחריים ולשלב אותם באפליקציות סגורות. הדרישה העיקרית היא לכלול את הצהרת זכויות היוצרים והרישיון המקורי.

האם המאגר מתאים לאימון מודל שמדבר עברית?

לא, המאגר לא מתאים למטרה זו כלל. יש בו רק 255 הודעות בעברית מתוך מעל 160 אלף הודעות בכל השפות. כמות כזו קטנה מדי כדי להשפיע על יכולות השפה של מודל.

איך המידע נאסף והאם הוא נוצר על ידי בינה מלאכותית?

הנתונים נאספו ממתנדבים אנושיים דרך אתר אינטרנט ייעודי ולא נלקחו מסינתזה של מודלים אחרים. המתנדבים כתבו את ההנחיות, ענו עליהן בעצמם ודירגו את התשובות של משתמשים אחרים. כל עץ עבר סינון ידני שכלל הסרת ספאם ובדיקת שפה.

באיזה פורמט מקבלים את הנתונים?

בטעינה רגילה דרך פייתון מקבלים טבלה שטוחה של הודעות בפורמט פרקט עם חלוקה מובנית לאימון ואימות. מי שמעדיף לעבוד ישירות עם עצי השיחה המלאים יכול להוריד קובצי jsonl דחוסים שמכילים את המבנה ההיררכי השלם.

איך טוענים

טוענים את הנתונים ישירות דרך הספרייה הרגילה של Hugging Face בלי צורך באישור גישה. החלוקה המובנית כוללת 84,437 הודעות לאימון ו־4,401 לוולידציה מתוך הסט המוכן.

הטעינה מגיעה כטבלה שטוחה של הודעות. כדי לשחזר את מבנה השיחה המקורי צריך לקשר בין השדות parent_id ו־message_id, ולהיעזר ב־message_tree_id ו־tree_state כדי לסנן את מצב השיחה הרצוי.

from datasets import load_dataset

ds = load_dataset("OpenAssistant/oasst1")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי מלא, שינוי והפצה של המידע ושל מודלים שאומנו עליו. הרישיון דורש מתן קרדיט מתאים וצירוף עותק הרישיון, אך אינו מחייב לפתוח את הקוד שלכם או לשתף תוצרים תחת אותו רישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗