GPT
R

rag-dataset-12000

קוד פתוח

neural-bridgeapache-2.02023-10-02

  • retrieval-augmented-generation

מאגר של 12,000 שלשות של הקשר, שאלה ותשובה באנגלית. הוא מתאים למי שרוצה לאמן או לבדוק מודל על משימות מענה מבוסס מקורות בלי לבנות דאטה סינתטי בעצמו.

  • 1,642הורדות בחודש
  • 166לייקים

מה זה

המאגר כולל בדיוק 12,000 רשומות שמיועדות למשימות שאלות ותשובות מבוססות הקשר. כל דוגמה בנויה משלושה שדות טקסט בלבד: context, question ו־answer. הטקסטים של ההקשר נלקחו מתוך המאגר הציבורי Falcon RefinedWeb, שהוא סריקת רשת מסוננת ומנוקה שנבנתה במקור לאימון מודלים. על בסיס פסקאות ההקשר האלו, צוות הפיתוח השתמש ב־GPT-4 כדי לחלץ ולנסח את השאלות ואת התשובות התואמות להן.

הכרטיס לא מפרט אילו הנחיות ניתנו ל־GPT-4, האם נערך סינון ידני על התוצרים, או מה היה אורך הקטעים הממוצע. הנתונים מגיעים מחולקים מראש לשני חלקים מוגדרים: קובץ אימון שמכיל 9,600 רשומות, וקובץ בדיקה שמכיל 2,400 רשומות. החלוקה הזו מקובלת ונוחה למי שרוצה בנצ'מרק מהיר בלי לחלק את המידע ידנית.

מתאים ל

  • אימון מודל קטן ל־RAG

    כוונון עדין של מודלי שפה פתוחים לחילוץ תשובות מדויקות מתוך פסקת הקשר נתונה.

  • הערכת ביצועי שליפה

    בדיקת איכות של מודל קיים על סט המבחן שמכיל 2,400 שאלות ותשובות באנגלית.

  • בניית אב טיפוס מהיר

    שימוש בנתונים מוכנים כדי לבחון צינור עיבוד שלם לפני שמשקיעים ביצירת דאטה ייעודי.

איפה זה נופל

החולשה המרכזית היא התלות המוחלטת ב־GPT-4 לייצור השאלות והתשובות, בלי שום תיעוד על בדיקת איכות אנושית או סינון הזיות. המאגר כולו באנגלית בלבד, ואין בו שום תמיכה בעברית. הטקסטים מבוססים על דפי אינטרנט כלליים, כך שהם לא מתאימים למערכות שדורשות עומק מקצועי, כמו רפואה או משפטים. בנוסף, חסרים מקרים שליליים שבהם התשובה לא נמצאת בהקשר, מצב קריטי לכל מוצר אמיתי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא Apache 2.0 שמתיר שימוש מסחרי מלא. יחד עם זאת, היוצרים מדגישים שחובה לפעול גם בהתאם לתנאי השימוש של מקור הטקסטים, Falcon RefinedWeb.

האם יש במאגר שאלות או הקשרים בעברית?

לא. כל 12,000 הרשומות מבוססות על טקסטים באנגלית בלבד. אם המוצר שלכם מיועד לשוק הישראלי, המאגר הזה לא יסייע לכם ישירות.

איך נוצרו השאלות והתשובות בדאטהסט?

פסקאות ההקשר נלקחו ממאגר Falcon RefinedWeb שמבוסס על סריקת הרשת. השאלות והתשובות התואמות לכל פסקה נוצרו באופן סינתטי באמצעות מודל GPT-4.

כמה שטח אחסון צריך כדי לעבוד איתו?

המאגר כולל 12,000 שורות שנשמרות בשני קובצי Parquet בלבד, אחד לאימון ואחד לבדיקה. המשקל שלהם זניח ומתאים לעבודה חלקה על כל מחשב פיתוח רגיל.

איך טוענים

טוענים את הנתונים ישירות דרך הספרייה של Hugging Face בפקודת load_dataset פשוטה עם המזהה של המאגר. הגישה פתוחה לגמרי ואין צורך בהרשמה מוקדמת או באישור של היוצרים. המאגר כולל ארבעה קבצים, מתוכם שני קובצי Parquet שמחזיקים את נתוני האימון והבדיקה. בגלל שמדובר ב־12,000 רשומות טקסט בלבד, המשקל הכולל של הקבצים מזערי וההורדה מסתיימת תוך שניות בודדות. המבנה שטוח לגמרי, כך שאחרי הטעינה ניגשים ישירות לשדות context, question ו־answer בלי צורך בעיבוד מקדים מורכב.

from datasets import load_dataset

ds = load_dataset("neural-bridge/rag-dataset-12000")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0 שמתיר שימוש מסחרי, שינוי והפצה, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. עם זאת, היוצרים מציינים שיש לציית גם לתנאי השימוש של Falcon RefinedWeb שמהם נלקחו הטקסטים. מודל שתאמנו עליו אינו מחויב בקוד פתוח.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗