GPT
N

no_robots

קוד פתוח

HuggingFaceH4cc-by-nc-4.02023-11-10

עשרת אלפים הוראות ותשובות שנכתבו בידי בני אדם ולא זוקקו מבינה מלאכותית. הבחירה בזה מתאימה למי שרוצה אימון SFT נקי מדאטה סינתטי של OpenAI.

  • 33,400הורדות בחודש
  • 575לייקים

מה זה

המאגר כולל 10,000 דוגמאות שנבנו לפי המבנה של מאמר InstructGPT המקורי. רוב הדאטה מורכב מהוראות של פנייה בודדת (single-turn), והוא מחולק לעשר קטגוריות שונות: יצירת טקסט מובילה עם 4,560 דוגמאות, שאלות פתוחות עם 1,240, סיעור מוחות עם 1,120, ושיחה עם 850. שאר הקטגוריות קטנות יותר וכוללות שכתוב, תמצות, קוד, סיווג, שאלות סגורות וחילוץ מידע.

הנתונים מחולקים לשני חלקים עיקריים, כאשר 9,500 דוגמאות נמצאות בסט האימון train_sft ועוד 500 שמורות לבדיקה ב־test_sft. פרטי תהליך הסינון, זהות המתייגים ודרך איסוף הטקסט המקורית אינם מפורטים בכרטיס.

מתאים ל

  • אימון SFT לא מסחרי

    כוונון מודלים בסיסיים לעמידה בהוראות על בסיס כתיבה אנושית בלבד, ללא מעורבות של מודל סגור.

  • מחקר על דאטה אנושי מול סינתטי

    השוואת ביצועים ואיכויות פלט של מודלים שאומנו על טקסט שנכתב בידי אדם לעומת דאטה שנוצר מ־GPT.

  • בדיקת יכולות יצירת טקסט

    שימוש בסט המבחן כדי לבדוק יכולות של מודל במשימות שכתוב, סיעור מוחות ותמצות באנגלית.

איפה זה נופל

הטקסט כולו באנגלית בלבד, כך שאין כאן שום מענה למשימות בעברית. יוצרי המאגר מציינים בעצמם שמודלים שאומנו עליו מקבלים ציונים נמוכים יותר במדדים כמו MT-Bench ו־AlpacaEval, כיוון שמדדים אלה נשענים על שופטים מבוססי מודלים שמגלים הטיה מובנית לטובת תשובות שנוצרו בידי GPT. מעבר לזה, הכרטיס חסר מידע קריטי על זהות המתייגים, מקורות הטקסט הגולמי והטיות תוכן ספציפיות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא CC BY-NC 4.0, מה שאוסר במפורש שימוש מסחרי. אימון מודל לצורך מוצר עסקי מפר את תנאי הרישיון הזה.

האם הדאטהסט כולל תמיכה בעברית?

לא, הדאטהסט מוגדר כולו בקוד שפה en ומכיל טקסטים באנגלית בלבד. מי שמחפש נתונים בעברית יצטרך לתרגם אותם בעצמו או לחפש מקור אחר.

מי כתב את הדוגמאות שבתוך המאגר?

לפי התיעוד מדובר במתייגים אנושיים מיומנים שיצרו את ההוראות והתשובות, ללא שימוש במודלים ממשפחת GPT. יחד עם זאת, הכרטיס לא מפרט מי היו האנשים או מאיזה רקע הם הגיעו.

למה מודלים שאומנו עליו מקבלים ציונים נמוכים בבנצ'מרקים מובילים?

בנצ'מרקים כמו AlpacaEval ו־MT-Bench משתמשים במודלים כמו GPT-4 כדי לדרג תשובות. לכלים האלה יש נטייה להעדיף ניסוחים שמזכירים את סגנון הכתיבה שלהם, ולכן כתיבה אנושית מקבלת לעיתים ניקוד נמוך יותר.

איך טוענים

טוענים את הדאטהסט ישירות דרך ספריית datasets באמצעות המזהה HuggingFaceH4/no_robots. אין צורך לבקש אישור גישה מראש. המאגר מכיל שישה קבצים, כולל קובצי parquet מוכנים לפיצולים של אימון ומבחן. המבנה כולל ארבעה שדות מרכזיים: prompt עם תיאור המשימה, prompt_id כמזהה ייחודי, messages כמערך הודעות שמגדיר תפקיד ותוכן, ו־category שמציין את סוג המשימה.

from datasets import load_dataset

ds = load_dataset("HuggingFaceH4/no_robots")

הרישיון

הרישיון הוא CC BY-NC 4.0. המשמעות ברורה וחדה, השימוש מוגבל למחקר ולהתנסות שאינם מסחריים בלבד. אסור למכור את הדאטה, אסור להשתמש בו ישירות במוצר מניב, ומודל שתאמנו עליו אינו פתוח לשימוש מסחרי. כל הפצה או שיתוף דורשים מתן קרדיט מלא למחברים המקוריים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗