GPT
P

Puffin

קוד פתוח

LDJnrapache-2.02023-08-10

  • Physics
  • Biology
  • Math
  • Chemistry
  • Culture

אוסף ממוקד של 3,000 שיחות רב-שלביות שנוצרו כולן באמצעות GPT-4. הוא מתאים למי שמחפש אימון שיחה ארוך ומעמיק יותר מהמקובל בלי להוריד מאגרים ענקיים ומלוכלכים.

  • 881הורדות בחודש
  • 97לייקים

מה זה

בפנים יש בדיוק 3,000 רשומות שמחולקות לשני מקורות עיקריים. החלק הראשון מכיל יותר מ־2,000 שיחות רב-שלביות אמיתיות בין בני אדם לבין GPT-4, שנלקחו מתוך ShareGPT וסוננו כך שיכללו רק אינטראקציות עם המודל הזה בעזרת תיוגים של צוות OpenChat. השיחות האלה ארוכות למדי, עם ממוצע של מעל עשרה חילופי דברים ואורך הקשר ממוצע שעובר את אלף הטוקנים.

החלק השני מורכב מדגימות שנבחרו ידנית מתוך מאגרי CamelAI בתחומי פיזיקה, מתמטיקה, ביולוגיה וכימיה, כאשר גם שם כל התשובות סונתזו באמצעות GPT-4. תהליך הסינון נעשה בשיתוף אנשי NousResearch וכלל ניקוי של ביטויי מוסר והתנערות קלאסיים כמו הודעות בנוסח בתור מודל שפה או התייחסויות לתאריך העדכון של ספטמבר 2021.

מתאים ל

  • אימון מודלי שיחה רב-שלביים

    כוונון עדין של מודלים פתוחים לניהול שיחות ארוכות ומורכבות עם מעל עשרה סבבים.

  • מענה על שאלות מדעיות

    שיפור יכולות ניסוח והסבר בנושאי פיזיקה, כימיה, ביולוגיה ומתמטיקה ברמת GPT-4.

  • ניקוי וסינון שיחות גולמיות

    שימוש כבסיס השוואה לזיהוי והסרה של תבניות מטיפות או ניסוחים רובוטיים של מודלי שפה.

איפה זה נופל

היוצר עצמו מצהיר באופן ברור שלא מומלץ להשתמש במאגר הזה ומפנה לגרסה חדשה יותר בשם Pure-Dove. מעבר לכך, הנתונים מבוססים על פלט סינתטי של מודל יחיד באנגלית בלבד ללא שום ייצוג לעברית, ותשובות המדעים והמתמטיקה טרם אומתו בידי מומחים אנושיים כך שייתכנו בהן שגיאות עובדתיות וחישוביות.

שאלות
נפוצות

האם המאגר מתאים לפרויקטים בעברית?

לא. הנתונים מתועדים באנגלית בלבד ואין בו דוגמאות בעברית. שימוש בו לצורך אימון ישפיע על יכולות השיחה באנגלית בלבד ולא יתרום לשפה המקומית.

האם מומלץ להתחיל לאמן מודל על הדאטהסט הזה היום?

לפי כרטיס המאגר עצמו התשובה היא לא. היוצר מציין מפורשות שאין המלצה להשתמש בו ומבקש לעבור לגרסה חדשה ומעודכנת יותר בשם Pure-Dove.

מאיפה הגיעו הנתונים של השיחות?

רוב הנתונים הגיעו מסינון של ShareGPT תוך בידוד שיחות GPT-4 בלבד בעזרת צוות OpenChat. החלק הנותר נלקח מקבוצות נתונים של CamelAI בתחומי מדעים מדויקים.

האם התשובות במדעים ובמתמטיקה נבדקו על ידי אנשי מקצוע?

לא. הכרטיס מציין שאימות התשובות מול בעלי תארים במדעים מוגדר כתוכנית עתידית, כך שחלק מהפתרונות עלולים להכיל שגיאות שהמודל המקורי יצר.

איך טוענים

המאגר פתוח לציבור ללא צורך באישור גישה מיוחד וכולל שלושה קבצים, כשהנתונים עצמם יושבים בקובץ Puffin.jsonl. בגלל שמדובר ב־3,000 דוגמאות בלבד, הקובץ קל מאוד להורדה ולטעינה מיידית בכל סביבת עבודה עם ספריית datasets או בקריאה ישירה של שורות JSON. המבנה מיועד למשימות של שיחה, מענה לשאלות ויצירת טקסט.

from datasets import load_dataset

ds = load_dataset("LDJnr/Puffin")

הרישיון

המאגר מסומן תחת רישיון apache-2.0 שמאפשר שימוש מסחרי, שינוי והפצה, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון. עם זאת, התוכן כולו מבוסס על פלטים של GPT-4 ונתוני ShareGPT, מה שיוצר סיכון משפטי מול תנאי השימוש של OpenAI בנוגע לאימון מודלים מתחרים, ולכן תווית הרישיון כאן לא מספרת את כל הסיפור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗