GPT
S

SlimOrca-Dedup

קוד פתוח

Open-Orcamit2023-10-13

  • code
  • art
  • music
  • legal
  • finance

גרסה מכווצת של SlimOrca שעברה ניקוי כפילויות ומכילה 363 אלף שיחות. מתאימה למי שרוצה לאמן מודל שיחה ומעדיף דאטה דחוס בלי דוגמאות כפולות ובלי סינון תכנים מקדים.

  • 1,076הורדות בחודש
  • 94לייקים

מה זה

המאגר מכיל שיחות מובנות במבנה ShareGPT קלאסי שכולל הודעות מערכת, פניות משתמש ותשובות של המודל. כל רשומה מציגה חילופי דברים מלאים, כשהמערכת מקבלת הנחיה, המשתמש מציג שאלה או משימה, והמודל עונה לו ישירות בהתאם להקשר.

הבסיס כאן הוא תת קבוצה של SlimOrca המקורי, שעברה שני שלבי עיבוד מרכזיים. בשלב הראשון הסירו את כל הדוגמאות של RLHF, ובשלב השני הריצו ניקוי כפילויות באמצעות אלגוריתם MinHash וחישובי דמיון ז'קארד. התוצאה היא אוסף ממוקד של 363 אלף דוגמאות ייחודיות.

הדאטהסט מוגדר כלא מסונן מבחינת תוכן, ונשמר כולו בחלוקת אימון המחולקת לשני קבצי Parquet. אין כאן חלוקה מובנית לערכות בדיקה או ולידציה, כך שמי שמאמן יצטרך לפצל את הנתונים בעצמו לפי הצרכים של הפרויקט.

מתאים ל

  • אימון הוראות למודלי שפה

    לימוד מודלים איך לעקוב אחרי הנחיות מערכת ולענות לפניות משתמשים בצורה קוהרנטית.

  • משימות שאלות ותשובות

    אימון על שיחות מגוונות כדי לשפר את יכולת המענה של מודל טקסטואלי.

  • סיווג טקסטים רב שלבי

    שימוש ברשומות שיחה לניתוח והבנת כוונות המשתמש לאורך דיאלוג.

איפה זה נופל

הכרטיס מגדיר את המאגר במפורש כלא מסונן, כך שאין שום הבטחה שהתוכן נקי מפגמים או רעלים, ואין פרטים על השפות שקיימות בטקסטים. אם המטרה שלכם היא מודל בעברית, קחו בחשבון שהבסיס כאן לא מתמקד בזה. בנוסף, חסר כאן פיצול מוכן לטסט או ולידציה, והדוגמאות אינן כוללות נתוני RLHF שהוסרו לחלוטין. לפני שמעלים מודל לסביבה אמיתית מול משתמשים, חובה לבדוק איזה פלטים הוא מייצר על מקרים רגישים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא MIT ומאפשר שימוש מסחרי ללא מגבלות על שיתוף התוצרים. חובה רק לשמור על הקרדיט ותנאי הרישיון המקוריים.

מה ההבדל בין המאגר הזה ל־SlimOrca המקורי?

הגרסה הזו עברה סינון כפילויות בעזרת MinHash ודמיון ז'קארד, וכל דוגמאות ה־RLHF נוקו ממנה. נשארו בה 363 אלף דוגמאות ייחודיות ללא סינון תכנים נוסף.

האם יש במאגר שיחות בעברית?

הכרטיס לא מציין תמיכה בעברית או את התפלגות השפות. המאגר מבוסס על נתוני שיחה כלליים, וקרוב לוודאי שרובו המוחלט באנגלית.

איך המידע מפורמט בתוך הקבצים?

הנתונים מגיעים בקבצי Parquet במבנה של ShareGPT. כל רשומה מכילה שדה שיחה עם הודעות המחולקות למערכת, משתמש ותשובת המודל.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets באמצעות המזהה Open-Orca/SlimOrca-Dedup. הגישה חופשית לחלוטין ואין צורך בהרשאות מיוחדות או במפתח גישה כדי למשוך את הקבצים. כל הדאטה יושב בתוך שני קבצי Parquet ברכבת האימון. השדה המרכזי והיחיד שמעניין אתכם נקרא conversations, ובתוכו תמצאו רשימה של אובייקטים עם שדות from ו־value. תצטרכו לפרק את המבנה הזה לפי הפורמט שרלוונטי לארכיטקטורת האימון שלכם.

from datasets import load_dataset

ds = load_dataset("Open-Orca/SlimOrca-Dedup")

הרישיון

הרישיון הוא MIT, מה שאומר חופש פעולה כמעט מלא. מותר לקחת את הנתונים, להשתמש בהם לצרכים מסחריים, לשנות אותם ולאמן מודלים בלי לחלוק את הקוד או את המשקולות. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים המקורית והפטור מאחריות של היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗