GPT
A

airoboros-3.2

קוד פתוח

jondurbincc-by-4.02024-01-02

  • not-for-all-audiences

המאגר מרכז נתוני שיחה סינתטיים לאימון מודלים פתוחים ללא צנזורה מובנית. הוא מיועד למי שמכוון ליכולות רב שיח ומחפש אלטרנטיבה שלא מסרבת לשאלות רגישות.

  • 652הורדות בחודש
  • 50לייקים

מה זה

הנתונים מהווים המשך ישיר לגרסה הקודמת של הפרויקט, תוך שינוי מכוון בהרכב התוכן. היוצר הסיר לחלוטין את נתוני MathJSON בגלל שהם בלבלו את המודלים ויצרו יותר בעיות מתועלת. במקומם הוחזרו נתונים שנועדו לבטל סירובים וצנזורה, כדי שמודל שעובר כוונון עדין ישיר יגיב לפניות בלי מעצורים מלאכותיים.

חלק ניכר מהנפח מבוסס על כ־11 אלף הוראות שנלקחו מתוך המאגר SlimOrca. ההוראות האלו הורחבו בסיבוב שיחה נוסף כדי לחזק את היכולת של המודל לנהל דיאלוג מתמשך. המבנה כולו עבר לפורמט ShareGPT, במטרה להתאים ישירות לכלי כוונון עדין נפוצים בקוד פתוח.

מתאים ל

  • כוונון מודלים ללא צנזורה

    אימון מודל שיחה שמגיב ישירות לכל שאלה בלי לסרב או להטיף מוסר למשתמש.

  • שיפור שיחות מרובות תורות

    חיזוק יכולת המעקב וההקשר של מודל לאורך דיאלוג מתמשך בעזרת הרחבות השיחה.

  • אימון בכלי קוד פתוח

    הזנה ישירה של שיחות בפורמט ShareGPT לכלי כוונון נפוצים ללא צורך בהמרת מבנה.

איפה זה נופל

הנתונים נוצרו ברובם בעזרת GPT-4 כמעט בלי בדיקה ואימות אנושיים, כך שהם מכילים שגיאות עובדתיות. יוצר המאגר מזהיר במפורש שחלק קטן מהדוגמאות כולל שפה בוטה, תכנים פוגעניים או נושאים רעילים, לצד הסרת מנגנוני הסירוב המקובלים. אין פה נתונים ייעודיים בעברית אלא אנגלית שנגזרה מהמקורות הסינתטיים. לא הייתי מכניס מודל שאומן על זה ישירות לשירות לקוחות או למוצר מסחרי בלי להוסיף שכבת סינון קפדנית משלכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון של המאגר הוא cc-by-4.0 שמתיר שימוש מסחרי תמורת קרדיט. הבעיה היא שהתוכן נוצר באמצעות GPT-4, ולפי תנאי השימוש של OpenAI אסור להשתמש בפלטים לאימון מודלים מתחרים. חברות מסחריות צריכות לקחת את הסיכון הזה בחשבון.

האם הדאטהסט כולל נתונים בעברית?

לא. המאגר מורכב מטקסטים באנגלית שנגזרו מ־SlimOrca ומייצור סינתטי. אם המטרה היא אימון בעברית, תצטרכו לתרגם את הנתונים או לשלב מאגרים מקומיים אחרים.

איך הנתונים נאספו ונבנו בפועל?

היוצר הרחיב כ־11 אלף הוראות מתוך SlimOrca לתור שיחה נוסף, החזיר דוגמאות שמבטלות סירובים, והסיר נתוני מתמטיקה שפגעו בדיוק. כל התוכן הופק באמצעות מודלים ולא עבר ניקוי אנושי מעמיק.

מה ההבדל בין הגרסה הזו לגרסה 3.1 הקודמת?

בגרסה הזו הוסרו נתוני MathJSON בגלל שהם יצרו בלבול במודלים, והוחזרו נתוני ביטול הצנזורה. בנוסף, כל המאגר הומר למבנה ShareGPT והורחב בתור שיחה נוסף עבור חלק מהדוגמאות.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות הזנת המזהה של המאגר, ללא צורך בהרשאה מוקדמת או בקשת גישה. הקובץ המרכזי שמכיל את הרשומות שמור כקובץ dataset.parquet, שזה הפורמט הסטנדרטי והנוח ביותר לעבודה מהירה ברוב תשתיות האימון.

מבנה הרשומות מוגדר בתצורת ShareGPT, כך שהעמודה המרכזית מייצגת את השיחות בתור רשימת תורות בין משתמש למודל. לפני שמזינים את הנתונים לצינור האימון, צריך לוודא שהטוקנייזר והתבנית שלכם יודעים לפענח את התפקידים ואת התור הנוסף שהוטמע בתוך הדיאלוגים.

from datasets import load_dataset

ds = load_dataset("jondurbin/airoboros-3.2")

הרישיון

המאגר מפורסם תחת רישיון cc-by-4.0 שמתיר שימוש מסחרי, שינוי והפצה תחת מתן ייחוס ליוצר. עם זאת, יש כאן מלכוד מעשי. הטקסטים יוצרו בעיקר באמצעות מודלים של OpenAI, ותנאי השימוש שלהם אוסרים על שימוש בפלטים שלהם כדי לאמן מודלים מתחרים. הרישיון המשפטי של הקבצים אמנם פתוח, אך מקור הנתונים עלול לחשוף אתכם להפרת תנאי השימוש של ספק הבסיס.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗