GPT
S

sharegpt_gpt4

קוד פתוח

shibing624cc-by-4.02023-07-27

שיחות רב-סבביות מול מודלי GPT-4 שנאספו מ־ShareGPT ומספקות דוגמאות אימון איכותיות למענה על שאלות, קידוד והסברים. מתאים למי שרוצה לאמן מודל שיחה שיודע להחזיק הקשר לאורך כמה חילופי דברים.

  • 1,721הורדות בחודש
  • 138לייקים

מה זה

המאגר מציע שיחות רב-סבביות מבוססות GPT-4 שנאספו מתוך פלטפורמת ShareGPT, במטרה לשמש משימות ייצור שפה וסיווג טקסט. המבנה האחיד בכל הקבצים מורכב משדה יחיד בשם conversations, המכיל רשימת מחרוזות שמייצגת את חילופי הדברים בין הצדדים לאורך הדיאלוג.

התוכן מחולק לשלושה קבצים עיקריים שפונים לצרכים שונים. הקובץ המרכזי sharegpt_gpt4.jsonl מכיל 6,206 רשומות שעברו ניקוי קפדני ומתמקדות בשאלות ידע, משימות תכנות והסברים לוגיים בכמה שפות, כולל אנגלית, סינית וקוריאנית. לצידו נמצא קובץ sharegpt_V3_format.jsonl עם 58,674 שיחות יומיומיות ומעט יותר סלנגיות מהגרסה המקורית, וקובץ ייעודי sharegpt_zh_38K_format.jsonl שכולל 38,535 שיחות בסינית המכסות תרגום, בקשות עזרה וקידוד.

מתאים ל

  • אימון מודלי שיחה

    כוונון עדין של מודלי שפה על שיחות רב-סבביות כדי לשפר הבנת הקשר ורצף דיאלוג.

  • עוזרי תכנות וקוד

    שימוש ברשומות המסוננות כדי ללמד מודל לפתור באגים ולכתוב פונקציות לפי הנחיות משתמש.

  • משימות סיווג וניתוח

    הערכה וסיווג של בקשות משתמש שונות מתוך שיחות טבעיות ולא מובנות.

איפה זה נופל

עברית לא מופיעה כאן בכלל, המאגר מתמקד בעיקר בסינית ובאנגלית עם נוכחות של שפות כמו גליסית וקוריאנית. מעבר לזה, הכרטיס לא מפרט תהליכי סינון של תוכן רעיל או מידע אישי. אם אתם מכוונים למוצר מוגמר, תצטרכו לבדוק בעצמכם אם אין שם הזיות או דליפות מידע.

שאלות
נפוצות

האם המאגר כולל שיחות בעברית?

לא. השפות המוגדרות במאגר הן סינית, אנגלית, גליסית וקוריאנית. אם אתם מאמנים מודל לשוק הישראלי, תצטרכו להביא מקורות נתונים אחרים.

האם מותר להשתמש בנתונים האלה למוצר מסחרי?

המאגר מפורסם תחת רישיון cc-by-4.0 שמתיר שימוש מסחרי עם ייחוס. יחד עם זאת, הטקסטים הם פלטים של GPT-4 מתוך ShareGPT, ולכן חשוב לוודא שאימון מודל מתחרה עליהם עומד בתנאי השימוש של ספקי המודלים.

כמה מקום הדאטהסט תופס בדיסק?

נפח הקבצים להורדה והשימוש בדיסק עומדים על 772 מגה-בייט. בסך הכל יש במאגר 103,415 רשומות שמחולקות לשלושה קובצי jsonl שונים.

איך טוענים

אתם מושכים את הקבצים ישירות מהמאגר ללא צורך בהרשאה מיוחדת, כשהנפח הכולל עומד על 772 מגה-בייט. הנתונים שמורים בקובצי jsonl, כך שכל שורה מכילה אובייקט עם שדה ה־conversations בלבד. לפני שמתחילים, מומלץ לבחור את הקובץ הספציפי שמתאים ליעד שלכם במקום לטעון את כל המאה אלף בבת אחת.

from datasets import load_dataset

ds = load_dataset("shibing624/sharegpt_gpt4")

הרישיון

הרישיון המדווח הוא cc-by-4.0, שמאפשר שימוש מסחרי, הפצה ושינוי בתנאי שנותנים ייחוס הולם למפרסם. עם זאת, הכרטיס מציין שהתנאים תואמים ל־ShareGPT המקורי ומתבססים על פלטים של GPT-4, כך שקיימת חשיפה לתנאי השימוש של יוצרי המודל המקורי לגבי שימוש בתוצרים שלהם לאימון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗