GPT
C

chatgpt-paraphrases

קוד פתוח

humarinopenrail2023-03-15

מאגר שמכיל כ־420 אלף טקסטים מקוריים באנגלית עם חמישה ניסוחים מחדש לכל אחד, שנוצרו באמצעות ChatGPT. הוא מיועד למי שרוצה לאמן מודלים של שכתוב בלי לייצר דאטה סינתטי מאפס.

  • 242הורדות בחודש
  • 60לייקים

מה זה

המאגר כולל כ־420 אלף שורות שנאספו משלושה מקורות מוכרים: 247,138 שאלות ממאגר השאלות של Quora, 91,983 קטעי טקסט מ־SQUAD 2.0, ועוד 80,076 קטעים ממאגר החדשות של CNN. לכל משפט או שאלה מקוריים המפרסמים הריצו פרומפט אחיד מול gpt-3.5-turbo שביקש רשימה ממוספרת של חמישה ניסוחים מחדש ללא תוספות.

מבנה הנתונים בסיסי וכולל ארבע עמודות בלבד. עמודת text מכילה את הטקסט המקורי, paraphrases מחזיקה רשימה של חמש הגרסאות שנוצרו, עמודת category מסווגת אם מדובר בשאלה או במשפט רגיל, ועמודת source מציינת מאיזה מאגר מקור השורה הגיעה.

מתאים ל

  • אימון מודל שכתוב

    כוונון מודלים קיימים כמו T5 למשימות של ניסוח מחדש של שאלות ומשפטים באנגלית.

  • אוגמנטציה של טקסט

    הרחבת מאגרי שאלות ומשפטים כדי לשפר ביצועים של מודלי סיווג או חילוץ מידע.

  • הערכת דמיון סמנטי

    יצירת זוגות משפטים בעלי אותה משמעות לצורך בדיקה של מודלי שיבוץ ודמיון טקסטואלי.

איפה זה נופל

הנתונים כולם באנגלית בלבד ונוצרו בשיטה עיוורת יחסית באמצעות פרומפט יחיד, כך שאין כאן בדיקת איכות אנושית על התוצרים או סינון של הזיות ואי-דיוקים. בנוסף, הניסוחים מגיעים כולם מגרסת gpt-3.5-turbo ממרץ 2023, על כל הסגנון וההטיות האופייניים לה. אם אתם בונים שירות שחייב עברית או שדורש דיוק עובדתי קפדני, תצטרכו להשקיע בסינון עצמאי של הפלט.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון הרשמי הוא openrail שמאפשר שימוש רחב, אבל יש כוכבית גדולה. המפרסמים מדגישים שתנאי השימוש של OpenAI אוסרים לנצל את הפלטים האלה כדי לאמן מודלים שמתחרים בהם. אם המוצר שלכם לא פונה לתחרות ישירה מולם, השימוש מותר.

האם המאגר כולל טקסטים בעברית?

לא, כל הנתונים במאגר הם באנגלית בלבד. מקורות המידע היו מאגרים באנגלית כמו Quora, SQuAD ו־CNN. אם המטרה שלכם היא עבודה עם עברית, המאגר הזה לא יתאים בלי תרגום משמעותי.

כמה דוגמאות אימון אפשר להפיק ממנו בפועל?

במאגר יש כ־420 אלף רשומות, ובכל אחת יש טקסט מקור וחמישה שכתובים. שילוב של המקור והשכתובים יחד מייצר שישה ניסוחים שונים לאותו רעיון. בחלוקה לזוגות ייחודיים אפשר לחלץ ממנו כ־6.3 מיליון זוגות אימון שונים.

איך טוענים

המאגר שמור בקובץ chatgpt_paraphrases.csv וזמין להורדה ישירה ללא צורך בהרשמה מוקדמת או באישור גישה. אפשר לטעון אותו בעזרת ספריית datasets או ישירות עם פנדס. כדאי לשים לב לחילוץ הרשימה מעמודת הפרפרזות, משום שכל שורה מאפשרת לפתוח זוגות אימון מרובים בהצלבה בין המקור לחמש החלופות שלו.

from datasets import load_dataset

ds = load_dataset("humarin/chatgpt-paraphrases")

הרישיון

המאגר פורסם תחת רישיון openrail, אך בכרטיס מצוינת הגבלה משמעותית מתנאי השימוש של OpenAI. מכיוון שהטקסטים נוצרו על ידי gpt-3.5-turbo, נאסר להשתמש בהם כדי לאמן מודלים שמתחרים ישירות במוצרים של OpenAI. מעבר לכך הרישיון דורש שמירה על תנאי שימוש אחראי ולא מטיל מגבלות שיתוף מיוחדות.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא ב־Hugging Face ↗