GPT
J

jat-dataset

קוד פתוח

jat-projectapache-2.02023-08-29

  • imitation-learning
  • reinforcement-learning
  • text-generation
  • question-answering
  • generalist-agent

מאגר ענק המשלב למידת חיזוק מטקסט, משחקי אטארי, משימות רובוטיקה וראייה ממוחשבת. מי שרוצה לאמן מודל יחיד שמתמודד גם עם שפה וגם עם קבלת החלטות בסביבות אינטראקטיביות ימצא כאן בסיס רחב.

  • 355,619הורדות בחודש
  • 78לייקים

מה זה

המאגר מאגד נתונים ממגוון סביבות שונות שנועדו לבניית מודלים רב משימתיים. הרשומות כוללות צעדי פעולה, תצפיות וגמולים מסביבות למידת חיזוק ידועות לצד זוגות של תמונה וטקסט ומשימות שפה. הנתונים סווגו לתצורות נפרדות עבור עשרות משחקי Atari, סביבות ניווט מבוססות רשת של BabyAI, משימות מניפולציה של זרוע רובוטית ב MetaWorld, וסימולציות פיזיקליות של MuJoCo.

לצד סביבות קבלת ההחלטות, המאגר משלב נתונים ממקורות חיצוניים כמו oscar ליצירת טקסט, ok-vqa למענה על שאלות חזותיות, ו Conceptual Captions לתיאור תמונות. לפי הכרטיס, התיוגים וההקלטות נוצרו משילוב של חילוץ ממאגרים קיימים ואיסוף אוטומטי ממוחשב. כל סביבה או משימה מפוצלת לקובצי אימון ומבחן עצמאיים.

מתאים ל

  • אימון סוכן רב תחומי

    אימון ארכיטקטורה אחת המסוגלת לשחק במשחקי וידאו, לשלוט ברובוט ולענות על שאלות.

  • מחקר על אופליין RL

    בדיקת אלגוריתמים ללמידת חיזוק ממסלולים מוכנים מראש בלי צורך בסימולטור פעיל.

  • בנצ׳מרק למודלי שפה ופעולה

    הערכת היכולת של מודלי שפה להבין פקודות ניווט מילוליות בתוך סביבות רשת כמו BabyAI.

איפה זה נופל

הכרטיס מודה שחלק ניכר מהמידע נוצר או תויג אוטומטית על ידי מכונה, כך שאיכות הדוגמאות אינה מובטחת ברמת מומחה אנושי. המאגר פורסם באוגוסט 2023 ואינו מציג עדכונים שוטפים. אין בו שום תמיכה בשפה העברית, והחלק הטקסטואלי נשען על מקורות באנגלית. המיקוד הוא בעיקר בסימולציות ממוחשבות, ולכן מודל שמאומן עליו עשוי להיכשל לחלוטין במעבר לרובוטיקה בעולם האמיתי ללא התאמות כבדות.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא apache-2.0 ומאפשר שימוש מסחרי מלא. אתם רשאים לאמן מודלים ולשלב אותם באפליקציות סגורות. התנאי המרכזי הוא שמירה על תנאי הרישיון ומתן ייחוס ליוצרים.

האם יש במאגר תמיכה בעברית?

לא, אין כאן נתונים ייעודיים בעברית. רכיבי הטקסט והשאלות נשענים על מאגרים באנגלית כמו ok-vqa ו Conceptual Captions. אם המטרה שלכם היא משימות בשפה העברית, תצטרכו להביא נתונים משלכם.

איך נאספו הנתונים במאגר?

הנתונים מחולקים לפי מקורות שונים ונשענים על שילוב של איסוף ממאגרים פתוחים ויצירה ממוחשבת. חלק מהמשימות נלקחו ישירות מסביבות אקדמיות קיימות, והמסלולים בסביבות המשחק נוצרו באופן אוטומטי. הכרטיס אינו מפרט את טיב המדיניות שייצרה את הצעדים.

האם חייבים להוריד את כל 3,533 הקבצים כדי להתחיל לעבוד?

ממש לא, המאגר מחולק לתצורות נפרדות לפי סביבות עבודה. אתם יכולים לטעון תצורה של משחק בודד או משימת רובוטיקה אחת בלבד בעזרת הפרמטר המתאים בספריית הטעינה. זה חוסך הורדה של עשרות משימות שאינן רלוונטיות לפרויקט שלכם.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות ציון שם התצורה הרצויה, למשל atari-pong או mujoco-halfcheetah. המאגר כולל 3,533 קבצים בפורמט Parquet, כך שאין שום צורך להוריד את כל המאגר בבת אחת. אין כאן דרישה לאישור גישה והמאגר פתוח לחלוטין. בכל תצורה תמצאו שדות שמייצגים את שלבי האינטראקציה, הטקסט או הפירוק לתמונות בהתאם למשימה הנבחרת.

from datasets import load_dataset

ds = load_dataset("jat-project/jat-dataset")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ואינו מחייב אתכם לחשוף את קוד המקור שלכם או לשתף את המודל תחת אותו רישיון. נדרש לשמור על הודעת זכויות היוצרים והטקסט של הרישיון המקורי. משקלי מודל שאומנו עליו יכולים לשמש במוצרים מסחריים בלי הגבלת הדדיות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗