GPT
O

orca-agentinstruct-1M-v1

קוד פתוח

microsoftcdla-permissive-2.02024-10-25

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מיליון זוגות הוראה ותשובה סינתטיים לגמרי שנוצרו באמצעות סוכנים ומבוססים על טקסט מהרשת. מיקרוסופט בנתה אותו כדי לאמן מודלי שפה על משימות חשיבה, תכנות והבנת נקרא.

  • 3,548הורדות בחודש
  • 466לייקים

מה זה

המאגר כולל סביב מיליון שיחות מלאות שנבנו בארכיטקטורה מבוססת סוכנים בשם AgentInstruct. הבסיס לכל הדוגמאות הוא טקסט גולמי ופומבי שנאסף מהאינטרנט ושימש כחומר גלם ראשוני. משם, תהליכי יצירה ייעודיים ניסחו גם את השאלות וגם את התשובות בעזרת Azure GPT-4, כך שאין כאן כתיבה אנושית ישירה בכלל.

המבנה הפנימי מחולק לפי קבצי נתונים שמשקפים סוגי יכולות שונים. בין הקבצים תמצאו חלוקה לנושאים מוגדרים כמו הסקת מסקנות אנליטית, שאלות אתגר וחשיבה, תכנות, כתיבה יצירתית, שאלות פרמי, ושיחות המשך. כל הרשומות מרוכזות תחת חלוקת אימון אחת ללא פיצול מובנה למבחן או אימות, ונועדו לכסות קשת רחבה של יכולות כמו עריכת טקסט, הבנת הנקרא ופתרון בעיות.

מתאים ל

  • אימון הוראות למודלי בסיס

    כוונון מודלי שפה פתוחים על מגוון יכולות שיחה, הבנת הנקרא ומעקב אחר פקודות מורכבות.

  • שיפור יכולות תכנות

    סינון קבצי הקוד וההסברים כדי לחזק כתיבת פונקציות ופתרון באגים במודל קיים.

  • מחקר על דאטה סינתטי

    בדיקת השפעת נתונים שנוצרו על ידי סוכנים לעומת כתיבה אנושית על מדדי ביצועים שונים.

איפה זה נופל

כל הנתונים סינתטיים לחלוטין ונכתבו באנגלית בלבד, בלי שום כיסוי לשפות אחרות או לעברית. בגלל שהכל נוצר באמצעות מודל שפה ולא נבדק ידנית, הדאטהסט יורש את ההטיות, הטעויות וההזיות של מודל המקור ושל הטקסטים שנאספו מהרשת. מיקרוסופט מציינת במפורש שהחומר לא משקף תחום מקצועי צר, ומזהירה שלא להכניס אותו למערכות חינוך או בריאות. אם המטרה היא מוצר אמיתי, חייבים לבדוק אי דיוקים בעובדות לפני שמאמנים עליו.

שאלות
נפוצות

האם יש בדאטהסט הזה תוכן בעברית?

לא. המאגר כולו נוצר באנגלית בלבד, ואינו כולל שפות נוספות או התייחסות למקורות מקומיים.

מותר להשתמש בו לאימון מודל מסחרי?

הרישיון המדווח, cdla-permissive-2.0, מתיר שימוש מסחרי ומאפשר לבנות מוצרים על בסיס הנתונים תוך מתן קרדיט. עם זאת, היוצרים מציינים בכרטיס שהדאטהסט שותף לצורכי מחקר ואינו מיועד למערכות בריאות או חינוך.

איך הנתונים נאספו ונבנו?

מיקרוסופט אספה טקסטים פומביים מהרשת כנקודת מוצא, והפעילה עליהם מערכת סוכנים שנקראת AgentInstruct. המערכת הזו השתמשה ב־Azure GPT-4 כדי לנסח הן את השאלות והן את התשובות באופן סינתטי מלא.

איך בנוי כל קובץ בדאטהסט?

הנתונים מחולקים לעשרים ושניים קבצי Parquet לפי נושאים שונים. בתוך כל קובץ תמצאו שדה יחיד שמכיל מחרוזת ג'ייסון בפורמט שיחה, וצריך לפענח אותה כדי לחלץ את תפקידי המשתמש והעוזר.

איך טוענים

הנתונים מגיעים בפורמט Parquet המחולק לעשרים ושניים קבצים שונים לפי נושאים, ואין צורך באישור גישה או ברישום מיוחד כדי להוריד אותם. כל רשומה כוללת שדה יחיד בשם messages, שהוא מחרוזת טקסט המייצגת שיחה במבנה המוכר של פניות משתמש ומערכת. כדי לעבוד עם הנתונים בפועל צריך להמיר את המחרוזת הזו למבנה נתונים אמיתי באמצעות פענוח ג'ייסון סטנדרטי. כדאי לשים לב לחלוקת הקבצים, כי היא מאפשרת לכם לטעון רק את התחומים שמעניינים אתכם, כמו קוד או חשיבה אנליטית, במקום למשוך את כל המיליון בבת אחת.

from datasets import load_dataset

ds = load_dataset("microsoft/orca-agentinstruct-1M-v1")

הרישיון

המאגר משוחרר תחת רישיון cdla-permissive-2.0. זהו רישיון מתירני שמאפשר שימוש חופשי בנתונים, כולל שימוש מסחרי והתאמה לצרכים שלכם, בלי חובה לשתף נגזרות באותו הרישיון. הדרישה העיקרית היא שמירה על הודעת הרישיון והייחוס המקוריים, כך שמבחינה משפטית של הרישיון עצמו מותר לאמן מודלים לכל מטרה.

הרישיון המלא ב־Hugging Face ↗