GPT
U

ultrachat_200k

קוד פתוח

HuggingFaceH4mit2023-10-24

גרסה מסוננת ומצומצמת של שיחות סינתטיות לאימון מודלי שיחה באנגלית. מי שבוחר בה מקבל נתונים שנוקו מתבניות רובוטיות מיותרות של צ'אטבוטים, מוכנים מיד לשימוש.

  • 113,727הורדות בחודש
  • 886לייקים

מה זה

הנתונים מבוססים על מאגר מקורי רחב של מיליון וארבע מאות אלף דיאלוגים שנוצרו באמצעות ChatGPT במגוון נושאים. הצוות בחר מתוכם תת קבוצה קטנה יותר כדי לאפשר אימון מהיר ויעיל, תוך ביצוע פעולות ניקוי ממוקדות. בין היתר הם תיקנו אותיות רישיות בכחמישה אחוזים מהטקסטים שבהם נמצאו שגיאות כתיב, והסירו שיחות שבהן הבוט ענה תשובות מתחמקות בסגנון אין לי רגשות או אין לי דעות על שאלות עובדתיות לחלוטין.

המבנה מחולק לארבעה חלקים עיקריים שפונים לשני צרכים שונים. עבור אימון בהנחיה ישירה יש 207,865 דוגמאות לאימון ועוד 23,110 למבחן. עבור שלבי דירוג ויצירה באמצעות שיטות כמו דגימת דחייה יש 256,032 דוגמאות לאימון ו־28,304 למבחן.

מתאים ל

  • אימון הנחיה למודלי שיחה

    משתמשים בפיצול ה־sft כדי ללמד מודל בסיס לנהל שיחה קולחת באנגלית לפי דוגמאות מובנות.

  • דירוג וסינון תשובות

    נעזרים בפיצול ה־gen לתהליכי דגימת דחייה או אופטימיזציה ישירה של איכות התשובה.

  • בדיקה והערכת מודלים

    מריצים מבחנים על קובצי ה־test כדי לבדוק איך המודל מתמודד עם שיחות רב שלביות.

איפה זה נופל

כל הטקסט כאן הוא באנגלית בלבד, ואין פה בכלל עברית. בנוסף, המקור כולו מבוסס על תוכן סינתטי שנוצר על ידי ChatGPT, כך שהטיות הסגנון והחשיבה של המודל המקורי מובנות בתוך הנתונים. אם אתם בונים מוצר לשוק המקומי או כזה שמחייב נתוני אמת של משתמשים אנושיים, תצטרכו לאסוף מידע נוסף ולא להסתמך רק על השיחות האלה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המוגדר הוא MIT והוא מתיר שימוש מסחרי ללא מגבלות מיוחדות. אתם נדרשים רק לכלול את הצהרת הרישיון המקורית. אין חובה לשתף את המודל המאומן באותו הרישיון.

האם הדאטהסט כולל תמיכה בעברית?

לא, הנתונים כולם באנגלית בלבד. אם תרצו לאמן מודל שיחה בעברית, המאגר הזה לא יספק לכם דוגמאות מתאימות. תצטרכו לתרגם את הנתונים או להשתמש במאגרי שיחה מקומיים.

איך נאסף המידע ואיך סונן?

הבסיס מגיע מ־1.4 מיליון דיאלוגים סינתטיים שיוצרו באמצעות ChatGPT. היוצרים חתכו תת קבוצה קטנה יותר, תיקנו אותיות רישיות פגומות, וזרקו תשובות רובוטיות שבהן הבוט סירב לענות בטענה שאין לו דעות.

מה ההבדל בין חלקי ה־sft לחלקי ה־gen?

חלקי ה־sft נבנו עבור שלב ההתאמה בהנחיה ישירה ומכילים שיחות שנועדו ללמד את המודל לענות היטב. חלקי ה־gen מיועדים למשימות מתקדמות יותר של דירוג פלטים ויצירה מונחית, כמו אלגוריתמי דחייה וחיזוק.

איך טוענים

טוענים את הקבצים ישירות מספריות פייתון המקובלות בלי צורך באישור גישה או הרשמה מוקדמת, כי המאגר פתוח לציבור. הנתונים שמורים בעשרה קובצי Parquet, חלוקה שמאפשרת עבודה מהירה ויעילה בצריכת זיכרון. לפני שמתחילים כדאי להחליט באיזה פיצול משתמשים, כי קובצי ה־sft מיועדים להתאמה ישירה בעוד שקובצי ה־gen מכוונים לתהליכי סינון ודירוג יצירה.

from datasets import load_dataset

ds = load_dataset("HuggingFaceH4/ultrachat_200k")

הרישיון

המאגר מופץ תחת רישיון MIT, מה שמתיר שימוש חופשי כולל שימוש מסחרי, שינוי והפצה, בתנאי ששומרים על הודעת זכויות היוצרים. הרישיון חל על הדאטהסט עצמו ולא מחייב אתכם לפתוח את קוד המודל שתאמנו עליו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗