GPT
G

gpt4all-j-prompt-generations

קוד פתוח

nomic-aiapache-2.02023-04-10

המאגר מרכז פרומפטים ותשובות ששימשו לאימון GPT4All-J. הוא מיועד למי שמחפש דאטה לאימון מודלים מונחי הוראות עם גרסאות שעברו סינון של סירובים ותשובות רובוטיות.

  • 524הורדות בחודש
  • 221לייקים

מה זה

המאגר כולל בין מאה אלף למיליון רשומות של פרומפטים ותשובות באנגלית, ומחולק לארבע גרסאות שונות שנוצרו כדי לשפר את איכות הפלט של המודל. גרסה 1.0 היא הדאטהסט המקורי ששימש לכוונון עדין של GPT-J ללא שינויים. בגרסה 1.1 הוסרו מופעים שבהם המודל מגדיר את עצמו כמודל שפה, ובגרסה 1.2 נוקו גם סירובים שמתחילים בהתנצלויות בנוסח אני מצטער אך איני יכול לענות.

הגרסה הרחבה ביותר היא 1.3, שבה נוספו נתונים ממאגרי Dolly ו־ShareGPT. לאחר המיזוג סוננו כ־8% מהרשומות זוהו ככפילויות סמנטיות באמצעות כלי המיפוי של Nomic AI. הנתונים מציגים התפתחות ברורה מאיסוף גולמי לסינון הדרגתי של רעשי שיחה וסירובים טיפוסיים שמאפיינים נתונים שנוצרו על ידי מודלים מסחריים.

מתאים ל

  • אימון מודלי הוראות

    כוונון מודלי שפה בסיסיים באנגלית למענה על הוראות ושאלות כלליות באמצעות דאטה שעבר סינון.

  • מחקר על סינון נתונים

    השוואת ביצועי מודלים שאומנו על גרסאות שונות כדי לבדוק את השפעת הסרת סירובים וכפילויות.

  • אימון LoRA קל משקל

    שימוש ברשומות המנוקות כדי לאמן מתאמי LoRA קטנים למודלים פתוחים במהירות ובמשאבים מוגבלים.

איפה זה נופל

כל הנתונים במאגר הם באנגלית בלבד, ואין בו שום תמיכה או ייצוג לשפות אחרות. אם המטרה שלכם היא מודל שמבין עברית, הדאטה הזה לא יסייע לכם ישירות. בנוסף, הנתונים פורסמו באפריל 2023 ומשקפים את סגנון הפרומפטים והיכולות של אותה תקופה. הגרסאות המוקדמות מכילות כמות משמעותית של סירובים ותשובות ממוחזרות, כך ששימוש בגרסה 1.0 עלול להכניס למודל שלכם הטיות של התחמקות ממענה.

שאלות
נפוצות

האם הדאטהסט מתאים לעבודה בעברית?

לא. המאגר כולל תוכן באנגלית בלבד ואינו מכיל רשומות בעברית. אימון עליו לא יוסיף יכולות עבריות למודל שלכם.

באיזו גרסה של המאגר כדאי לבחור?

לרוב עדיף לבחור ב־v1.2-jazzy שמסננת תשובות מתחמקות, או ב־v1.3-groovy שמרחיבה את המקורות ומסירה כפילויות סמנטיות. גרסה 1.0 מומלצת רק אם אתם רוצים לשחזר בדיוק את GPT4All-J המקורי.

האם צריך אישור גישה מיוחד כדי להוריד את הקבצים?

אין צורך באישור. המאגר פתוח לחלוטין לציבור וניתן להוריד את קבצי ה־parquet ישירות דרך הספרייה הרשמית של Hugging Face.

האם מותר להשתמש בו למוצר מסחרי?

הרישיון המוגדר הוא apache-2.0, שמאפשר שימוש מסחרי חופשי בכפוף למתן קרדיט. יחד עם זאת, כדאי לזכור שהנתונים מבוססים בחלקם על פלטים של מודלים אחרים ויש לבדוק את תנאי השימוש שלהם.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות הנתיב nomic-ai/gpt4all-j-prompt-generations. המאגר פתוח לציבור ואינו דורש אישור גישה מראש. הנתונים שמורים בארבעה קבצי parquet בפיצול train, כך שהטעינה יעילה ואינה דורשת עיבוד מוקדם של קבצי טקסט גולמיים.

ברירת המחדל מושכת את גרסה 1.0, שהיא הגרסה הבסיסית והלא מסוננת. אם רוצים להשתמש בגרסאות הנקיות יותר או בזו שכוללת את Dolly ו־ShareGPT, חובה להגדיר את הפרמטר revision בקריאה לטעינה, למשל v1.2-jazzy או v1.3-groovy, אחרת מקבלים את הדאטה הגולמי.

from datasets import load_dataset

ds = load_dataset("nomic-ai/gpt4all-j-prompt-generations")

הרישיון

המאגר פורסם תחת רישיון apache-2.0. רישיון זה מאפשר שימוש מסחרי, שינוי והפצה של הנתונים, לצד אימון מודלים לכל מטרה, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. אין חובה לשתף את המודל המאומן או יצירות נגזרות תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗