GPT
P

Pure-Dove

קוד פתוח

LDJnrapache-2.02023-09-26

  • Physics
  • Biology
  • Math
  • Chemistry
  • Culture

מדובר במאגר של שיחות רב שלביות בין בני אדם ל־GPT-4 שעברו סינון קפדני. המטרה כאן היא להוסיף דוגמאות שיחה איכותיות במיוחד לאימון קיים כדי לשפר את התנהגות המודל.

  • 189הורדות בחודש
  • 80לייקים

מה זה

המאגר מכיל מעל 3,000 שיחות רב שלביות עם אורך הקשר ממוצע של מעל 800 טוקנים. הנתונים נלקחו ממאגרים ציבוריים כמו ShareGPT ו־ChatBot Arena של ארגון LMSYS, אך עברו תהליך ניקוי אגרסיבי במיוחד בעזרת חוקרים מ־NousResearch.

במקום לשמור כל פלט, המפתח סינן שיחות שכללו הזיות של המודל, מוסרנות מלאכותית וביטויים קבועים כמו הצהרות על היותו מודל שפה או אזכורי תאריך ידע ישנים. בנוסף, מתוך ההשוואות של ChatBot Arena נשמרו רק תשובות שקיבלו דירוג עדיף אפילו מול גרסאות אחרות של GPT-4, תוך הוצאת מקרים שבהם שתי התשובות דורגו כרעות או כשקולות.

מתאים ל

  • תוספת עזר לכוונון שיחות

    חיזוק אימון קיים של מודל שיחה על ידי שילוב אלפי דוגמאות רב שלביות באיכות גבוהה.

  • הפחתת מוסרנות במענה

    אימון מודלים לייצר תשובות נקיות מביטויים רובוטיים מתנצלים על היותם כלי בינה מלאכותית.

  • בדיקת איכות של מענה אנושי

    שימוש בשיחות מסוננות ומדורגות כמדד להערכת איכות של מודלים מול תשובות GPT-4 מנצחות.

איפה זה נופל

המאגר מוגדר באנגלית בלבד ולכן הוא חסר תועלת לחלוטין אם אתם מכוונים לאימון על עברית. היוצר מבהיר שהדאטהסט אינו מיועד לאימון עצמאי מלא אלא כתוספת בלבד, בעיקר בגלל גודלו המצומצם שמכיל מעל 3,000 דוגמאות בלבד. בנוסף, למרות הניקוי מטעויות והזיות, תהליך אימות מתמטי ומדעי מלא על ידי מומחים הוגדר רק כתוכנית עתידית, כך שעדיין ייתכנו שגיאות עובדתיות בפלטים שנשמרו.

שאלות
נפוצות

האם יש במאגר שיחות בעברית?

לא. המאגר מוגדר ומסומן באנגלית בלבד. במסגרת תהליך הסינון הוסרו התפלגויות חריגות של שפות אחרות, כך שהוא אינו מתאים למי שמחפש נתונים מקומיים.

האם אפשר להשתמש בדאטהסט לפיתוח מסחרי?

כן, הרישיון המדווח הוא apache-2.0 שמאפשר שימוש מסחרי מלא. עם זאת, היוצר מציין במפורש בדרישותיו לתת קרדיט נאות לפרויקט בעת השימוש בנתונים.

במה הוא שונה מסתם הורדה של ShareGPT או ChatBot Arena?

ההבדל טמון בסינון הקפדני. נופו ממנו תבניות טקסט מנג'סות של בינה מלאכותית, הזיות, ותשובות ממוצעות, ונשמרו רק אינטראקציות של GPT-4 שגברו בבירור על חלופות אחרות.

האם המאגר מספיק כדי לאמן מודל מאפס?

לא. המאגר כולל קצת מעל 3,000 דוגמאות והיוצר עצמו מסביר שהוא לא נועד לעמוד בפני עצמו, אלא לשמש כחיזוק איכותי לצד מאגרי שיחה רחבים יותר.

איך טוענים

הנתונים מגיעים בקובץ Pure-Dove.jsonl שפתוח להורדה ישירה ללא צורך באישור גישה או הרשמה מוקדמת. אפשר לטעון אותו בעזרת ספריית datasets או לקרוא ישירות את שורות ה־JSON באמצעות סקריפט פייתון סטנדרטי. המאגר קטן יחסית, סביב אלפי רשומות בודדות, ולכן הוא נטען במהירות ולא דורש משאבי זיכרון חריגים בזמן העיבוד הראשוני.

from datasets import load_dataset

ds = load_dataset("LDJnr/Pure-Dove")

הרישיון

המאגר מפורסם תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הנתונים והפצה שלהם, ללא חובה לשתף נגזרות תחת אותו רישיון בדיוק. התנאי המרכזי שנדרש הוא מתן קרדיט וייחוס מתאים ליוצר, לצד שמירה על תנאי הרישיון המקוריים בכל שימוש או אימון של מודל שמבוסס עליו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗