GPT
A

arxiv_qa

קוד פתוח

taesiricc-by-4.02023-07-11

מאגר שאלות ותשובות שנוצר אוטומטית מתוך מאמרים מדעיים. מתאים למי שרוצה לאמן או לבחון מודלים על הבנת טקסט אקדמי מורכב באנגלית.

  • 379הורדות בחודש
  • 138לייקים

מה זה

המאגר מרכז זוגות של שאלות ותשובות שמבוססים על מאמרים מדעיים מתוך אתר ArXiv, החל משנת 2009 ועד שנת 2023. הנתונים הופקו באופן אוטומטי באמצעות מודל השפה Claude-2.1 של חברת Anthropic, שתמכה בפרויקט וסיפקה גישה לממשק שלה. הכרטיס אינו מפרט תהליך סינון ידני או בדיקות איכות אנושיות שנעשו על הפלטים, כך שמדובר בתוכן שנוצר ישירות ממכונה.

בתוך המאגר תמצאו קובץ נתונים ראשי בפורמט Parquet שמכיל את חלוקת האימון, לצד ארכיון זיפ של מאמרים ודפי מרקדאון שמקשרים לכל מאמר באתר המקורי ולתוצאות השאלות והתשובות שלו בגיטהאב. המאמרים מכסים מגוון תחומים, בעיקר סביב למידת מכונה, ראייה ממוחשבת ומודלים של שפה.

מתאים ל

  • אימון מודלי מענה לשאלות

    התאמת מודלי שפה להבנה ומענה על שאלות מדעיות מורכבות.

  • הערכת ביצועים על חומר אקדמי

    בדיקת יכולת המודל לחלץ עובדות מדויקות מתוך מאמרים באנגלית.

  • בניית מערכות שליפה למחקר

    טיוב מערכות חיפוש וסיוע לחוקרים באיתור מידע ממאמרי ArXiv.

איפה זה נופל

הנתונים כולם נוצרו על ידי מודל שפה ולא עברו אימות של מומחים אנושיים, מה שאומר שהתשובות יכולות להכיל הזיות או אי דיוקים טכניים. המאגר כולו באנגלית בלבד, ואין בו שום תמיכה בעברית או במאמרים משפות אחרות. רוב המאמרים שמוצגים מגיעים מתחומי מדעי המחשב והבינה המלאכותית, ולכן הוא פחות יתאים למי שמחפש ידע ברפואה, פיזיקה קלאסית או מדעי הרוח. בנוסף, המאמרים העדכניים ביותר בו הם מסוף שנת 2023, כך שכל מה שפורסם מאז פשוט לא קיים שם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, הרישיון הוא cc-by-4.0 שמתיר שימוש מסחרי מלא. אתם רק צריכים לתת קרדיט ברור ליוצר המאגר. אין חובה לפתוח את הקוד או את המודלים שתאמנו עליו.

האם יש במאגר שאלות ותשובות בעברית?

לא, המאגר כולו באנגלית בלבד. כל המאמרים נאספו מ־ArXiv בשפה האנגלית והשאלות הופקו באנגלית. אם אתם צריכים נתונים בעברית תצטרכו לתרגם אותם בעצמכם.

איך נאספו השאלות והתשובות בפועל?

היוצר השתמש במודל Claude-2.1 כדי לקרוא את המאמרים ולייצר את השאלות והתשובות באופן אוטומטי. הפרויקט קיבל גישה לממשק ישירות מחברת Anthropic. לא מצוין בכרטיס שהיה תהליך בדיקה אנושי נוסף.

אילו שנים המאגר מכסה?

המאמרים במאגר מתפרסים על פני השנים 2009 עד 2023. המאמרים האחרונים שנוספו אליו הם מחודש דצמבר 2023. פרסומים חדשים יותר לא נכללים בו.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בפייתון או מושכים את קובץ ה־Parquet היחיד שיושב בתיקיית data. אין צורך לבקש אישור גישה מיוחד או למלא טופס, המאגר פתוח לחלוטין להורדה מיידית. מלבד קובץ הנתונים עצמו, המאגר כולל קובץ זיפ עם המאמרים הגולמיים, למי שרוצה לגשת לטקסט המקורי המלא. מומלץ לבדוק את התאמת הפורמט של השאלות והתשובות למבנה הפרומפטים שלכם לפני שמתחילים להריץ אימון מלא.

from datasets import load_dataset

ds = load_dataset("taesiri/arxiv_qa")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון הזה מתיר שימוש מסחרי ומאפשר לשתף ולעבד את החומרים בחופשיות. התנאי המרכזי הוא מתן קרדיט מתאים ליוצר, taesiri, וציון הרישיון המקורי. אפשר להשתמש בנתונים לאימון מודלים מסחריים בלי חובה לשחרר את המודל עצמו תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗