GPT
U

UltraChat

קוד פתוח

openbmbmit2023-04-20

מאגר שיחות מרובות תורות שנוצרו על ידי שני מודלי טורבו של ChatGPT שדיברו זה עם זה. הוא מיועד למי שמחפש מידע מובנה לאימון עוזרי שיחה ומעדיף נתונים סינתטיים מטעמי פרטיות.

  • 4,864הורדות בחודש
  • 502לייקים

מה זה

הנתונים מחולקים לשלושה תחומים מרכזיים. החלק הראשון מכסה שאלות על מושגים ואובייקטים בעולם כמו טכנולוגיה, אמנות ויזמות. החלק השני מתמקד ביצירה וכתיבה מאפס, מכתיבת מיילים ועד מחזות ונרטיבים. החלק השלישי מוקדש לעבודה על חומרים קיימים, כולל שכתוב, סיכום, הסקת מסקנות והמשך טקסט.

המפתחים לא לקחו פרומפטים ישירות מהרשת כדי להגן על פרטיות. במקום זה, הם השתמשו בבוט אחד שחיקה משתמש אנושי בעזרת פרומפטים ייעודיים, ובבוט שני שענה לו. השיחות נוצרו בצורה איטרטיבית בין שני ה־APIs ועברו סינון ועיבוד מקדים כדי לשמור על האיכות של התוכן.

מתאים ל

  • אימון צ'אטבוטים רב-שלביים

    כוונון עדין של מודלי שפה על דיאלוגים ארוכים ששומרים על הקשר לכל אורך השיחה.

  • עוזרי כתיבה ועריכה

    הדרכת מודלים במשימות סיכום, שכתוב של טקסטים קיימים ויצירת תוכן חדש כמו מיילים.

  • מענה לשאלות כלליות

    לימוד מודלים כיצד להסביר מושגים מורכבים בנושאי טכנולוגיה, יזמות ומדע.

איפה זה נופל

המאגר מכיל שיחות בשפה האנגלית בלבד, כך שהוא לא יעזור למי שמאמן מודל בעברית. כל הנתונים סינתטיים ונוצרו על ידי מודלים של טורבו שפורסמו לפני אפריל 2023, בלי התערבות של משתמשים אמיתיים בשלב הפרומפטים. המשמעות היא שההטיות, שגיאות ההזיה והסגנון הספציפי של המודלים האלה מוטמעים עמוק בתוך השיחות, ומומלץ לבדוק את אמינות המידע העובדתי לפני שימוש במוצר אמיתי.

שאלות
נפוצות

האם המאגר כולל שיחות בעברית?

לא. המאגר מוגדר וכולל נתונים בשפה האנגלית בלבד. אם המטרה היא אימון בעברית, תצטרכו לתרגם את החומר או לחפש מקור אחר.

האם מותר להשתמש בזה לפיתוח מוצר מסחרי?

הרישיון בדף המאגר הוא MIT, שמתיר שימוש מסחרי חופשי עם מתן קרדיט. עם זאת, השיחות נוצרו באמצעות ה־API של ChatGPT, ולכן חובה לוודא שהשימוש שלכם אינו מתנגש עם תנאי השימוש של המודל שיצר את הטקסט.

מאיפה הגיעו הפרומפטים של המשתמשים?

הפרומפטים לא נלקחו ממשתמשים באינטרנט. החוקרים השתמשו ב־ChatGPT אחד שתוכנת לדמות משתמש אנושי, והוא יצר את השאלות מול ChatGPT שני שענה לו, מטעמי הגנה על פרטיות.

איך בנויים הקבצים בפועל?

המאגר מכיל קובצי train_0.jsonl עד train_6.jsonl. בכל שורה יש מזהה בשם id ומערך בשם data שמכיל את תורות השיחה בזה אחר זה בטקסט רגיל.

איך טוענים

הגישה למאגר פתוחה לחלוטין ואין צורך באישורי גישה מיוחדים. המידע מחולק ל־12 קבצים, כולל שבעה קובצי train בפורמט jsonl הממוספרים מ־0 עד 6. כל שורה בקבצים האלה היא אובייקט JSON פשוט שמכיל שני שדות: id מספרי שמזהה את השיחה, ורשימה בשם data שכוללת את רצף ההודעות בשיחה לפי סדר הופעתן.

from datasets import load_dataset

ds = load_dataset("openbmb/UltraChat")

הרישיון

היוצרים מדווחים על רישיון MIT, שמתיר שימוש מסחרי, שינוי והפצה ללא הגבלת שיתוף זהה, כל עוד שומרים על הודעת זכויות היוצרים. יחד עם זאת, כיוון שהטקסט הופק כולו ישירות משימוש ב־ChatGPT Turbo APIs, עליכם לקחת בחשבון את תנאי השימוש של ספק ה־API לגבי שימוש בפלטים שלו לאימון מודלים מתחרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗