GPT
S

ShareGPT-Chinese-English-90k

קוד פתוח

shareAIapache-2.02023-04-15

  • code

שיחות אמיתיות של משתמשים מול ChatGPT במבנה מקבילי מלא של אנגלית וסינית. מי שמאמן מודל שיחה דו לשוני מקבל כאן ניסוחי שאלות אותנטיים ולא טקסט סינתטי שהופק בלולאות תוכנה.

  • 2,764הורדות בחודש
  • 286לייקים

מה זה

המאגר מכיל עשרות אלפי רשומות של שיחות אדם מול מכונה, בהיקף שנע בין עשרת אלפים למאה אלף דוגמאות. הבסיס נלקח משיתופים ציבוריים של גולשים מפלטפורמת ShareGPT. היוצרים טוענים שהעובדה שמשתמשים בחרו לשתף את השיחות יצרה סינון אנושי טבעי, כזה שהשאיר בחוץ אינטראקציות גרועות או שבורות.

התוכן עבר תרגום והתאמה כדי לייצר קורפוס מקבילי עם זהות סמנטית בין שתי השפות, אנגלית וסינית, בתמיכה כספית של חברה מסחרית שמימנה את התרגום. המבנה הפנימי במאגר מחולק לקבצים שונים, ביניהם קובצי JSONL כמו קובץ ייעודי של 26 אלף רשומות בנושאי מחשוב באנגלית, וארכיון המכיל כמעט שמונים אלף רשומות שיחה.

מתאים ל

  • אימון מודל שיחה דו לשוני

    התאמת מודלים לייצור תשובות מקבילות ומדויקות באנגלית ובסינית מתוך שאלות אותנטיות של משתמשים.

  • כוונון עדין למענה לשאלות

    לימוד מודלים כיצד לפרק שאלות מורכבות בעולם המחשוב באמצעות קובצי השיחה הייעודיים.

  • מחקר על הנחיות אנושיות

    ניתוח אופן הניסוח האמיתי של בני אדם מול מנועי בינה מלאכותית בהשוואה לנתונים סינתטיים.

איפה זה נופל

אין כאן מילה אחת בעברית. המאגר מוגבל אך ורק לאנגלית ולסינית, ונאסף סביב תחילת שנת 2023. יוצרי המאגר מציינים בעצמם שהנתונים נשענים על פלטים של גרסאות מוקדמות של GPT 3.5, ולכן כל הטיה, שגיאה עובדתית או סגנון דיבור של המודל הזה הועתקו ישירות פנימה. בנוסף, לא מפורט מנגנון סינון אוטומטי של מידע רגיש, פרטיות או תוכן פוגעני מעבר לשיקול הדעת של הגולש ששיתף את הקישור.

שאלות
נפוצות

האם הדאטהסט כולל עברית?

לא. המאגר מתמקד כולו באנגלית ובסינית בלבד, ואין בו טקסט בעברית. אם המטרה שלכם היא מודל שמבין או עונה בעברית, הנתונים האלה לא יעזרו לכם.

מותר להשתמש בו לאימון מודל מסחרי?

הרישיון המוצהר בדף הוא Apache 2.0 שמתיר שימוש מסחרי, אך הנתונים מכילים שיחות שהופקו על ידי ChatGPT. תנאי השימוש של OpenAI עשויים להגביל שימוש בפלטים שלהם לצורך אימון מודלים מסחריים מתחרים, ולכן יש כאן סיכון משפטי נפרד מהרישיון של המאגר עצמו.

באיזה פורמט שמורים הקבצים?

הנתונים מסודרים בתצורת Firefly וכוללים קובצי JSONL וקובצי ZIP דחוסים. כדי לעבוד איתם בתצורת ShareGPT סטנדרטית, צריך להריץ את סקריפטי ההמרה המצורפים למאגר.

איך הנתונים נאספו והאם עברו סינון?

השיחות לוקטו משיתופים ציבוריים שהעלו גולשים מתוך אינטראקציות עם ChatGPT, ולא יוצרו באמצעות קריאות API יזומות. הסינון העיקרי המתואר הוא הבחירה האנושית של המשתמשים לשתף את השיחה, ללא פירוט על סינון שיטתי נוסף של שגיאות או תוכן בעייתי.

איך טוענים

המאגר פתוח להורדה ישירה ללא צורך באישור גישה מוקדם, אך הוא אינו מוגש בתצורת טעינה של שורה אחת מקובץ יחיד. הנתונים שמורים בפורמט מותאם לשלד התוכנה Firefly, לצד קובצי ארכיון דחוסים בזיפ וסקריפטים בפייתון כמו change_info.py המיועדים להמרת המבנה לפורמט ShareGPT הרגיל. תצטרכו להוריד את הקבצים, לפרוס אותם ולעבד את השדות בהתאם לכלי האימון שלכם.

from datasets import load_dataset

ds = load_dataset("shareAI/ShareGPT-Chinese-English-90k")

הרישיון

הרישיון המדווח במאגר הוא Apache 2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה של הקוד והנתונים, כל עוד שומרים על הודעת הרישיון ומעניקים ייחוס מתאים ליוצרים. עם זאת, יש לזכור שהנתונים מבוססים על פלטים של ChatGPT, עובדה שעלולה להתנגש עם תנאי השימוש של שירות המקור ביחס לאימון מודלים מתחרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗