GPT
N

natural-instructions

קוד פתוח

Muennighoffרישיון לא דווח2022-12-17

עיבוד מראש של Super-Natural-Instructions לאימון מודלים על פקודות מגוונות באנגלית. הוא מרכז מאות משימות מעובדות מקורפוסים מוכרים כדי ללמד מודל לבצע הוראות שונות על אותו קלט.

  • 14,302הורדות בחודש
  • 85לייקים

מה זה

המאגר מכיל גרסה שעברה עיבוד מקדים של Super-Natural-Instructions מבית מכון אלן לבינה מלאכותית. הקבצים מחולקים לפי משימות ספציפיות בפורמט jsonl, כמו סיווג טקסט, מענה על שאלות, יצירת סיכומים ופירוק לוגי. הנתונים מתבססים על מאגרי מקור מוכרים כמו SQuAD, משימות מתוך GLUE, ביקורות של אמזון ו־BigBench.

המבנה של הרשומות כולל שדות של id, קלטים והוראות משימה, לצד הפלטים הרלוונטיים. הכרטיס מציין במפורש שאותו קלט בדיוק יכול להופיע עם פלטים שונים בהתאם למשימה שהוגדרה לו. המפרסם מציע לסנן כפילויות לפי שדה המזהה הייחודי או לפי שדה הקלטים, בהתאם ליעדי הניסוי שלכם.

מתאים ל

  • אימון מודל על פקודות

    לימוד מודלי שפה לבצע מגוון פעולות שונות על טקסט לפי הוראה ישירה.

  • הערכת יכולות הכללה

    בדיקת ביצועים של מודלים על סוגי שאלות וניסוחים שלא ראו קודם.

  • אימון לסיווג תוכן

    התאמת המודל לזיהוי רגשות, נושאים ורעילות מתוך דוגמאות מובנות.

איפה זה נופל

הנתונים כולם באנגלית בלבד, כך שאין כאן שום תמיכה במשימות בעברית. בנוסף, משימות רבות מכילות תוכן רעיל או מוטה במכוון שנלקח ממאגרים כמו Civil Comments או CrowS-Pairs לצורכי סיווג וזיהוי שנאה. אם תאמנו על הטקסטים האלה בלי סינון קפדני של משימות הדורשות יצירת טקסט חופשי, אתם מסתכנים בכך שהמודל ייצר פלטים בעייתיים או פוגעניים בסביבת ייצור.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ להסתמך עליו למטרות מסחריות כרגע. בדף המאגר לא צוין רישיון, ולכן אין אישור שימוש רשמי. עליכם לבדוק את הרישיון המקורי בגיטהאב של מכון אלן עבור המשימות הספציפיות.

האם המאגר כולל דוגמאות בעברית?

לא, המאגר מוגדר וכולל נתונים בשפה האנגלית בלבד. אם אתם מחפשים לאמן מודלים להבנה או ליצירה של עברית, הדאטהסט הזה לא יתאים למטרה.

מדוע אותו קלט מופיע במאגר כמה פעמים?

הדאטהסט בנוי סביב משימות שונות שמבוצעות על אותו הטקסט. הוראה אחת עשויה לבקש שאילת שאלה על הפסקה, בעוד הוראה אחרת תבקש לסווג אותה. אפשר לסנן כפילויות לפי id או inputs.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets או מורידים את קובצי ה־jsonl מתוך 879 הקבצים שבמאגר. אין צורך באישור גישה מיוחד, המאגר פתוח לחלוטין להורדה. לפני שמתחילים לאמן, חייבים לשים לב לשדות id ו־inputs, כי אם לא תסננו כפילויות מראש, המודל יראה את אותו טקסט עם מטרות שונות.

from datasets import load_dataset

ds = load_dataset("Muennighoff/natural-instructions")

הרישיון

הרישיון לא דווח בעמוד המאגר. המשמעות פשוטה: אין לכם היתר משפטי ברור להשתמש בנתונים האלה, בטח שלא במוצר מסחרי. לפני שאתם משלבים אותו בפיתוח, תצטרכו לגשת למאגר המקורי של מכון אלן ולבדוק את תנאי השימוש של כל משימה ומקור בנפרד.

הרישיון המלא ב־Hugging Face ↗