GPT
S

ShareGPT52K

קוד פתוח

RyokoAIcc0-1.02023-04-01

  • conversation
  • rlhf
  • chatgpt
  • gpt-3.5

שיחות אמיתיות בין אנשים לבין ChatGPT שנשמרו ברשת ונגרדו לקובץ אחד. זה בדיוק המאגר ששימש את הקהילה בגל הראשון של מודלי שיחה פתוחים.

  • 874הורדות בחודש
  • 362לייקים

מה זה

המאגר מכיל שיחות מלאות בין משתמשים לבין ChatGPT, כולל השאלות והתשובות שנוצרו במקור בשירות של OpenAI. המידע נגרד מתוך הממשק של ShareGPT לפני שהוא נסגר, ולפי הכרטיס המקור הראשוני שלו הגיע מהדלפה או גרידה שפורסמה בפורום 4chan. לא מדובר בטקסט שנאסף בניסוי מבוקר, אלא בכל מה שאנשים בחרו לשתף ציבורית באותה תקופה.

המבנה של כל רשומה כולל מזהה שיחה ומערך של הודעות, כאשר לכל הודעה מסומן מי כתב אותה, המשתמש או המודל. הטקסט עצמו שמור כתוכן HTML גולמי, בלי ניקוי מוקדם של תגיות או עיצובים. במאגר יש כעת גרסה מורחבת של כתשעים אלף שיחות שמחולקת לשני קבצים בשם sg_90k_part1.json ו־sg_90k_part2.json, לצד קובץ ישן יותר בתיקיית old שמכיל את גרסת ה־52 אלף המקורית.

מתאים ל

  • אימון מודל שיחה בסיסי

    כוונון עדין של מודלי שפה על דיאלוגים מרובי שלבים באנגלית, כדי ללמד אותם מבנה שיחה של עוזר וירטואלי.

  • ניתוח שאילתות משתמשים

    חקר הנושאים, הסגנון והשאלות האמיתיות שאנשים מפנים למודלי שפה כשהם נעזרים בהם ביום יום.

  • מחקר על הטיות מודלים

    בדיקת התשובות והסירובים של ChatGPT באותה תקופה על מגוון נושאים רחב שנאסף ממשתמשי קצה.

איפה זה נופל

הטקסט מכיל את כל ההטיות המובנות של ChatGPT בגרסאות GPT-3.5 ו־GPT-4, יחד עם ההטיות של האנשים שבחרו לשתף את השיחות. אין כאן שום סינון שנעשה מראש על ידי מי שהעלה את המאגר. הוא מכיל תגיות HTML, תשובות שבלוניות של המערכת, וייתכן שגם פרטים אישיים של משתמשים שהזינו מידע רגיש בצ'אט למרות האזהרות של OpenAI. בנוסף, רוב התוכן מורכב מאנגלית ושפות מערביות אחרות, כך שאם אתם בונים על עברית, היא כמעט ולא קיימת כאן ומחייבת בדיקה מדגמית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

הרישיון המדווח במאגר הוא CC0 ומבחינת יוצרי הדף אין עליו זכויות. עם זאת, התוכן מבוסס על פלטים של ChatGPT, ו־OpenAI מגבילה שימוש בפלטים שלה לאימון מודלים מתחרים. מעלה המאגר טוען שהתנאים האלה לא חלים על מי שמוריד את הקובץ, אבל הסיכון המשפטי נשאר אצלכם.

האם יש במאגר שיחות בעברית?

הכרטיס מגדיר את השפות העיקריות כאנגלית ושפות מערביות אחרות, עם תגית כללית של multilingual. יכול להיות שיש כמה שיחות בודדות בעברית שנשמרו על ידי משתמשים ישראלים, אבל המאגר לא מתאים לבניית מודל שמיועד לשפה העברית.

איך המידע הזה נאסף במקור?

הנתונים נגרדו דרך הממשק של אתר ShareGPT, שאיפשר לאנשים ליצור קישור ציבורי לשיחות שלהם עם ChatGPT. לפי התיעוד בכרטיס, משתמש אנונימי מפורום 4chan גרד את השיחות לפני שהממשק נסגר והפיץ את הקבצים ברשת.

באיזה פורמט המידע שמור ומה צריך לעשות לפני אימון?

הקבצים שמורים בפורמט JSON רגיל שמחולק לשני חלקים. הטקסט בכל שיחה כולל תגיות HTML ישירות מהאתר, ולכן תצטרכו להריץ תהליך של פירוק ה־HTML, ניקוי תווים מיוחדים וסינון תשובות חסומות או שגיאות לפני שתזינו אותו למודל.

איך טוענים

הנתונים יושבים בקובצי JSON רגילים, בלי דרישה לאישור גישה ובלי תהליך הרשמה מיוחד. אתם מורידים ישירות את שני חלקי ה־90K או את הקובץ הישן, ופותחים אותם עם כל ספריית קריאה סטנדרטית בפייתון. אין כאן חלוקה מובנית לסט אימון ובדיקה, כך שתצטרכו לפצל את הרשומות בעצמכם.

לפני שרצים לאמן מודל, חובה להעביר את הנתונים ניקוי יסודי. השדה החשוב ביותר הוא conversations שמכיל את תורות השיחה, אבל הערכים בתוכו שמורים בפורמט HTML גולמי, מה שמחייב הסרה של תגיות וסינון תשובות שבלוניות לפני שהטקסט הופך לטוקנים.

from datasets import load_dataset

ds = load_dataset("RyokoAI/ShareGPT52K")

הרישיון

המאגר מפורסם תחת רישיון CC0, שמוותר על כל זכויות היוצרים ומאפשר שימוש חופשי לגמרי, כולל שימוש מסחרי, ללא צורך בייחוס וללא דרישה לשתף את המודל המאומן באותו רישיון. מעלה המאגר טוען שתנאי השימוש של OpenAI לא חלים עליכם כיוון שאינכם ניגשים ישירות לשירות שלהם, אך זו פרשנות משפטית שלו ולא הגנה רשמית.

הרישיון המלא ב־Hugging Face ↗