GPT
R

research-plan-gen

קוד פתוח

facebookרישיון לא דווח2025-12-28

מאגר שמחבר בין מטרות מחקר אקדמיות לבין מחווני הערכה ופתרונות ייחוס. הוא פונה למי שמנסה ללמד מודלים לתכנן ניסויים ומחקרים מדעיים באופן מובנה.

  • 332הורדות בחודש
  • 302לייקים

מה זה

המאגר מציע משימות מחקר לצד רובריקות הערכה ותשובות ייחוס שמבוססות על מאמרים מדעיים. הוא מחולק לשלושה תתי מאגרים נפרדים: מאמרי למידת מכונה, מאמרים מכלל ארקייב, ומאמרים ממאגר פאבמד הרפואי. יחד הם מקיפים מעל 22 אלף רשומות, כשרובן משמשות לאימון והשאר למבחן.

המבנה של כל רשומה כולל מטרת מחקר, רשימת קריטריונים להערכת התוכנית, ופתרון ייחוס שמסכם כיצד החוקרים המקוריים ניגשו למשימה. פתרונות אלה סוכמו באמצעות המודל Llama4-maverick. בנוסף, כל שורה כוללת מזהי מאמר מקוריים כמו מזהה אופן-ריוויו, ארקייב או פאבמד, מה שמאפשר לחזור לטקסט המקור במידת הצורך.

מתאים ל

  • אימון מודלים לתכנון מדעי

    לימוד מודלים לפרק שאלת מחקר לשלבי ביצוע מוגדרים על בסיס מטרות מדעיות אמיתיות.

  • הערכת תוכניות מחקר

    שימוש במחווני ההערכה המוכנים כדי למדוד איכות של הצעות מחקר שמודל מייצר.

  • בניית מודלי שופט למדע

    כוונון מודלים לתת ציונים ומשוב לתוכניות עבודה אקדמיות בעזרת הרובריקות.

איפה זה נופל

החולשה המרכזית היא שהפתרונות, המטרות והרובריקות נוצרו כולם על ידי מודל שפה ולא נכתבו ידנית על ידי חוקרים. זה אומר שהטיות או שגיאות של לאמה 4 מחלחלות ישירות לתוך קריטריוני הבדיקה.

מעבר לכך, כל הטקסטים מבוססים על מאמרים מדעיים באנגלית בלבד ואין פה נתונים בעברית. שדות הסיווג לא עקביים בין התחומים, מה שמקשה על סינון ממוקד לפי תתי תחומים ספציפיים בחלק הרפואי או בלמידת מכונה.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

לא. הנתונים שוחררו תחת רישיון לא מסחרי ומיועדים לצורכי הערכה בלבד. בנוסף, חלים עליהם תנאי הרישיון של מטא שמגבילים את אופן ההפצה של מודלים שאומנו עליהם.

האם יש במאגר טקסטים בעברית?

אין במאגר עברית בכלל. כל הרשומות מבוססות על מאמרים אקדמיים באנגלית מתחומי הרפואה, למידת המכונה ומדעים מדויקים, וגם הפלטים של המודל נוצרו באנגלית.

איך נאספו הנתונים ומה מקור התשובות?

הנתונים נשענים על מזהי מאמרים מתוך ארקייב, פאבמד ואופן-ריוויו. מטרות המחקר, קריטריוני ההערכה ותוכניות הייחוס נוצרו כולם בצורה סינתטית על ידי המודל לאמה 4 על בסיס אותם מאמרים.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בפייתון על ידי ציון שם המאגר ואחד מתתי המאגרים: ml, arxiv או pubmed. הקבצים מגיעים בפורמט פרקט ואין צורך באישור גישה מיוחד כדי להוריד אותם.

בתוך הרשומה תמצאו את שדות המטרה והרובריקה שהם קריטיים לאימון או להערכה. שימו לב ששדות הסיווג והתחום אינם מלאים בכל החלקים, ומופיעים בעיקר בחלק של ארקייב.

from datasets import load_dataset

ds = load_dataset("facebook/research-plan-gen")

הרישיון

המאגר שוחרר תחת רישיון CC-by-NC ומיועד למטרות בדיקה בלבד, כך ששימוש מסחרי אסור. מאחר שהתוכן הופק באמצעות לאמה 4, חלים עליו גם תנאי הרישיון של מטא. אם תאמנו או תכווננו מודל באמצעות הנתונים האלה ותפיצו אותו, אתם מחויבים להוסיף את המילה Llama בתחילת שמו.

הרישיון המלא ב־Hugging Face ↗