GPT
L

lab-bench

קוד פתוח

futurehousecc-by-sa-4.02024-07-13

  • biology

מאגר שאלות ותשובות לבדיקת יכולות ביולוגיות ומחקריות של מודלי שפה. מי שמפתח סוכנים לביולוגיה ימצא כאן תרחישים אמיתיים מספרות מדעית, תרשימים ופרוטוקולים.

  • 18,066הורדות בחודש
  • 51לייקים

מה זה

המאגר מיועד להערכת סוכני שפה בביולוגיה וכולל בין אלף לעשרת אלפים רשומות, המחולקות לשמונה קטגוריות ראשיות ושלושים משימות משנה. הדוגמאות מגיעות בצורת קובצי פרקט ומכסות שליפת מידע ממאגרי נתונים, ניתוח ספרות מדעית, פתרון תקלות בפרוטוקולים ביולוגיים, עיבוד רצפים גנטיים, וכן ניתוח טבלאות ותרשימים.

התרחישים בוחנים גם משימות מורכבות של שיבוט מולקולרי. החומר הגלמי מבוסס על מאמרים ונתונים מדעיים, כאשר היוצרים החליפו כחלק מעדכון חלק מתמונות FigQA כדי להבטיח שהן נלקחות מפרסומים בקוד פתוח. אין פירוט בכרטיס לגבי תהליך הסינון המלא של יתר הטקסטים מעבר לעדכונים נקודתיים אלו.

מתאים ל

  • הערכת סוכנים לביולוגיה

    בדיקת יכולת המודל לפתור בעיות שיבוט, להבין פרוטוקולי מעבדה ולנתח רצפים גנטיים.

  • מבחן שליפת מידע מדעי

    מדידת ביצועים על שאלות ותשובות מתוך מאמרים אקדמיים ומאגרי נתונים ייעודיים.

  • פענוח תרשימים וטבלאות

    בחינת יכולות מולטימודליות על איורים מדעיים ממקורות פתוחים וטבלאות נתונים.

איפה זה נופל

המאגר כולו באנגלית ומכוון לביולוגיה בלבד, כך שאין כאן שום תמיכה או רלוונטיות לעברית. בנוסף, מדובר רק בכ־80% מהנתונים המלאים, כך שהציון שתקבלו מקומית אינו כולל את סט הבדיקה השמור. היוצרים כבר נאלצו לתקן שגיאות בשימוש באנזימי הגבלה בחלק מ־SeqQA וזכויות יוצרים בתמונות של FigQA, ולכן ייתכנו אי דיוקים מדעיים נוספים שלא תוקנו במשימות אחרות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון cc-by-sa-4.0 מתיר עקרונית שימוש מסחרי, אך דורש מתן ייחוס ושיתוף זהה. המשמעות היא שכל נגזרת של המאגר חייבת להשתחרר באותו רישיון חופשי, מה שעלול לחשוף אתכם לסיכונים אם תאמנו עליו מודל מסחרי קנייני.

האם יש במאגר שאלות בעברית?

לא. כל הנתונים, המאמרים, הפרוטוקולים והשאלות מבוססים על הספרות המדעית הבינלאומית וכתובים באנגלית בלבד. אין בו שום תוכן מקומי.

האם כל הדאטהסט המקורי נמצא כאן?

לא, המאגר הציבורי הזה כולל בערך 80% מהנתונים. היוצרים שמרו 20% כסט מבחן פרטי כדי לאתר זליגה של שאלות המבחן לאימון של מודלים עתידיים.

איך נאספו הנתונים?

הנתונים נאספו מתוך ספרות מדעית בביולוגיה, מאגרי מידע, פרוטוקולים ותרשימים ממאמרים פתוחים. הם חולקו לשמונה קטגוריות עיקריות ונבדקו נקודתית בעדכונים מאוחרים לתיקון תקלות כמו אנזימי הגבלה וזכויות יוצרים.

איך טוענים

אתם מושכים את הקבצים ישירות מהמאגר בתצורת parquet, ללא צורך בהרשאות גישה מיוחדות או אישור מוקדם. המאגר מכיל 11 קבצים, שכוללים חלוקה לפי תיקיות של המשימות השונות כמו LitQA2, SeqQA ו־CloningScenarios. שימו לב שהמאגר הציבורי מכיל רק כ־80% מכלל הנתונים, בעוד שהשאר מוחזק פרטית כדי לבדוק זליגת נתונים. בנוסף, יש מחרוזת canary שנועדה למנוע אימון בטעות של מודלים על שאלות המבחן.

from datasets import load_dataset

ds = load_dataset("futurehouse/lab-bench")

הרישיון

הרישיון הוא cc-by-sa-4.0. הוא מאפשר שימוש מסחרי, אך מחייב מתן קרדיט ליוצרים. המשמעות הקריטית היא סעיף השיתוף הזהה, אם תשנו או תבנו דאטהסט חדש המבוסס עליו, תהיו חייבים להפיץ אותו תחת אותו הרישיון בדיוק. לגבי מודלים שאומנו עליו, עניין הנגזרת שנוי במחלוקת משפטית אך יוצר סיכון משפטי ברור.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗