GPT
T

ThePromptReport

קוד פתוח

PromptSystematicReviewmit2023-10-27

  • prompt engineering
  • dataset
  • papers
  • academic papers
  • arxiv

מאגר מסודר של אלפי מאמרים אקדמיים על הנדסת פרומפטים מ־arXiv, כולל קובצי ה־PDF עצמם. מי שחוקר טכניקות פרומפטינג או בונה סקירה שיטתית ימצא כאן את כל החומר גולמי ומקוטלג.

  • 2,933הורדות בחודש
  • 47לייקים

מה זה

המאגר מרכז ספרות מחקרית על פרומפטים שנאספה ישירות מ־arXiv עבור מאמר סקירה שיטתי. המבנה שלו פשוט מאוד ומבוסס על קובצי טבלאות וספריית מסמכים. יש כאן 1,570 קבצים, והם מחולקים לפי שלבי העבודה של החוקרים.

הבסיס כולל קובץ עם המאמרים המקוריים שנשלחו לבדיקה אנושית, רשימה שחורה של מאמרים שנפסלו כי נמצאו לא רלוונטיים, וקובץ מאסטר סופי שמרכז את כל מה שעבר את הסינון. לצד קובצי ה־CSV האלה נמצאת תיקיית מסמכים מלאה שמכילה את מאמרי ה־PDF המלאים לאחר תהליך של איסוף, ניקוי כפילויות וביקורת אנושית.

מתאים ל

  • סקירת ספרות אוטומטית

    חילוץ וניתוח של מגמות, טקסונומיות ושיטות פרומפטים מתוך מאות מאמרי מחקר מסוננים.

  • אימון מודלים על טקסט מדעי

    כריית טקסט מקובצי ה־PDF כדי לאמן מודלים שמתמחים בניתוח מאמרים ובמחקר בבינה מלאכותית.

  • מחקר על תהליכי סינון

    השוואה בין המאגר המלא, הרשימה השחורה והמאגר הסופי כדי לחקור הטיות בביקורת עמיתים וסינון מסמכים.

איפה זה נופל

הנתונים מוגבלים לשפה האנגלית בלבד, וכוללים רק מאמרים שהועלו ל־arXiv עד מועד פרסום המאגר באוקטובר 2023. אין כאן כיסוי לטכניקות חדשות יותר או לעבודה שלא פורסמה באפיק הזה. בנוסף, מדובר במאמרים אקדמיים מלאים ולא בזוגות מוכנים של פרומפט ותשובה, כך שאי אפשר להזין את זה ישירות לאימון מודל בלי לעשות חילוץ טקסט, ניקוי ועיבוד מקדים משמעותי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון שמוגדר למאגר הוא MIT, שמתיר שימוש מסחרי ללא תמלוגים. עם זאת, המאגר כולל קובצי PDF של מאמרים מ־arXiv שנכתבו בידי מחברים שונים, ולכן כדאי לוודא שאיסוף הטקסט מהם עומד בכללי השימוש ההוגן הרלוונטיים לפרויקט שלכם.

האם יש במאגר נתונים בעברית?

לא. כל המאמרים, הטבלאות והמטא-דאטה במאגר הם באנגלית בלבד. אם המטרה היא לחקור שיטות פרומפטים בשפות אחרות, תצטרכו לאסוף מקורות נוספים בעצמכם.

כמה שוקל הדאטהסט ואיך מורידים אותו?

בגלל שיש במאגר מעל 1,500 קבצים ורובם מסמכי PDF מלאים, המשקל הכולל משמעותי ולא מדובר בקובץ טקסט קל. מומלץ להוריד אותו באמצעות Git LFS או דרך הכלים של Hugging Face Hub ישירות למחשב עם חיבור יציב.

איך נאספו וסוננו המאמרים?

החוקרים אספו מאגר ראשוני של מאמרים בנושא פרומפטים מ־arXiv, והעבירו אותו תהליך של ביקורת אנושית והסרת כפילויות. מאמרים שנמצאו לא רלוונטיים הועברו לקובץ נפרד של רשימה שחורה, והשאר נשמרו בקובץ המאסטר ובתיקיית הניירות הסופית.

איך טוענים

מושכים את הנתונים דרך Hugging Face Hub או ישירות עם Git LFS, בגלל שרוב הנפח מורכב מקובצי PDF של מאמרים שלמים. אין צורך באישור גישה מיוחד, המאגר פתוח לחלוטין להורדה. הקבצים המרכזיים לעבודה עם מטא-דאטה הם master_papers.csv ו־blacklist.csv שמכילים את המידע הטבלאי, והוראות הרצת הניסויים המלאות נמצאות בריפו ה־GitHub של הפרויקט.

from datasets import load_dataset

ds = load_dataset("PromptSystematicReview/ThePromptReport")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי ומחקרי מלא, כולל שינוי והפצה, בלי דרישה לשתף תוצרים באותו רישיון. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי. אם מאמנים מודל על הטקסטים, חשוב לזכור שה־PDF עצמם הגיעו מ־arXiv, שם לכל מאמר עשויות להיות זכויות יוצרים של כותביו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗