GPT
O

orca-agentinstruct-1M-v1-cleaned

קוד פתוח

mlabonnecdla-permissive-2.02024-11-17

מערך נתונים סינתטי שמבוסס על AgentInstruct של מיקרוסופט ועבר ניקוי טכני כדי שלא יקרוס לכם באימון. הוא נועד לשפר יכולות היסק, מענה לשאלות וקוד במודלים פתוחים.

  • 348הורדות בחודש
  • 69לייקים

מה זה

המאגר מבוסס על orca-agentinstruct-1M-v1 שמיקרוסופט שחררה, והוא בעצמו תת קבוצה מתוך פרויקט רחב יותר של כעשרים וחמישה מיליון דוגמאות. כל המידע כאן נוצר באופן סינתטי לחלוטין על בסיס טקסטים גולמיים שנאספו מהרשת. לפי הדיווח של מיקרוסופט על אורקה שלוש, הנתונים האלה הביאו לקפיצה של עשרות אחוזים במבחנים כמו GSM8K, AGIEval ו־AlpacaEval בהשוואה למודל הבסיס.

הגרסה הזו עברה סידור מחדש של מבנה הנתונים. המפרסם איחד את כל החלוקות למאגר יחיד עם עמודה שמציינת את החלוקה המקורית, המיר מחרוזות למבנה של רשימות מילונים כדי שיתאימו לספריות אימון מודרניות, ומחק הנחיות מערכת ריקות. הדוגמאות מחולקות לקטגוריות שונות שכוללות חילוץ טקסט, בעיות היגיון, פתרון בעיות פרמי, כתיבת קוד, RAG, שאלות רב ברירה ויצירת תוכן.

מתאים ל

  • אימון יכולות היסק ומתמטיקה

    כוונון מודלים על בעיות פרמי, פתרון בעיות צעד אחר צעד והיגיון אנליטי לפי הקטגוריות הקיימות.

  • שיפור משימות חילוץ ו־RAG

    אימון מודל לעבודה מול מסמכים בעזרת דוגמאות מובנות של אחזור מידע, מענה על שאלות וסיווג טקסט.

  • כוונון עדין למודלי קוד

    שימוש ברשומות מתחום התכנות כדי לחזק יכולות פיתוח ופתרון בעיות טכניות במודלי שיחה כלליים.

איפה זה נופל

הנתונים כולם באנגלית, כך שאין כאן שום מענה למי שמחפש לכוונן מודל לעברית. בנוסף, מדובר בדאטה סינתטי לחלוטין שמבוסס על טקסט שנקצר מהאינטרנט. זה אומר שאי אפשר להסתמך עליו כמקור ידע עובדתי, וצריך לבדוק טוב הזיות והטיות מובנות של מודלים גדולים לפני שמשלבים מודל שאומן עליו במערכות ייצור.

שאלות
נפוצות

האם מותר להשתמש במאגר הזה לצורך מסחרי?

כן, הרישיון המדווח הוא cdla-permissive-2.0 שמאפשר שימוש מסחרי רחב. הרישיון לא דורש שיתוף של הנגזרות באותו אופן, כך שניתן לאמן עליו מודלים מסחריים בלי לחשוף את המשקולות. עם זאת, יש לוודא עמידה בתנאי השימוש של נתוני המקור ששימשו ליצירתו.

האם יש בדאטהסט הזה תוכן בעברית?

לא, המאגר מסומן כדובר אנגלית בלבד. כל הדוגמאות, המשימות והשאלות נבנו באנגלית על בסיס טקסטים מהרשת. אם המטרה היא התאמה לעברית, תצטרכו לתרגם אותו או לשלב מאגרים מקומיים נוספים.

מה ההבדל בין הגרסה הזו לגרסה המקורית של מיקרוסופט?

התוכן מבוסס על אותו מאגר של מיקרוסופט, אך עבר התאמות טכניות שמקלות על תהליך האימון. המחבר הסיר הנחיות מערכת ריקות שעלולות לשבש מודלים מסוימים. בנוסף, הנתונים המבניים הומרו למילונים וכל החלוקות אוחדו לקובץ רציף עם עמודת חלוקה.

איך הנתונים האלה נוצרו במקור?

המידע נוצר בצורה סינתטית לחלוטין במסגרת מחקר AgentInstruct של מיקרוסופט. החוקרים לקחו טקסטים גולמיים שפורסמו ברשת והשתמשו במודלים כדי לייצר מתוכם שאלות, משימות ותשובות מפורטות. הדאטהסט הזה הוא תת קבוצה של כמיליון דוגמאות מתוך הפרויקט המלא.

איך טוענים

הנתונים מגיעים בקבצי Parquet שמחולקים לעשרה חלקים בתיקיית המידע. אין צורך לבקש אישור גישה מיוחד, אפשר לטעון ישירות דרך הספרייה של Hugging Face עם המזהה של המאגר. בגלל שהטקסטים כבר מומרים למבנה של רשימות ומילונים ונמחקו שורות המערכת הריקות, אפשר להזין אותם ישירות לצינורות כוונון עדין של מודלי שיחה בלי לבצע התאמות מבנה ידניות.

from datasets import load_dataset

ds = load_dataset("mlabonne/orca-agentinstruct-1M-v1-cleaned")

הרישיון

המאגר מופץ תחת רישיון cdla-permissive-2.0. זהו רישיון פתוח ומתירני שמאפשר שימוש מסחרי, שינוי ושיתוף של הנתונים, ואינו מחייב אתכם לשחרר מודלים שאימנתם תחת אותו רישיון בדיוק, כל עוד שומרים על תנאי הייחוס הבסיסיים של הרישיון.

הרישיון המלא ב־Hugging Face ↗