GPT
S

SciRIFF

קוד פתוח

allenaiodc-by2024-06-11

  • chemistry
  • biomedicine
  • clinical medicine
  • artificial intelligence
  • materials science

137 אלף הדגמות של מילוי הוראות על פני 54 משימות הבנת ספרות מדעית. הוא פותר את הצורך בהתאמת מודלי שפה למאמרים ומחקר בחמישה תחומים שונים.

  • 2,321הורדות בחודש
  • 49לייקים

מה זה

המאגר מאגד משימות קיימות של הבנת ספרות מדעית שהומרו למבנה אחיד של הוראה ותוצאה צפויה. כל רשומה כוללת שדות קלט, פלט, מזהה ייחודי ומטא דאטא שמפרט את משפחת המשימה, התחום המדעי, סוג ההקשר והמקור.

התוכן נאסף ממאגרים אקדמיים מוכרים כמו אוסף BigBio, מחקרי BioCreative ומאמרים ספציפיים. הוא מכסה חמישה תחומים: רפואה קלינית, ביו-רפואה, כימיה, בינה מלאכותית ומדעי החומרים, לצד קטגוריית שונות. המשימות מחולקות לחמש משפחות: סיכום, חילוץ מידע, מענה על שאלות, היסק וסיווג. הקלטים נעים בין משפט בודד, פסקאות מרובות ועד טבלאות קוד בלאטך.

מתאים ל

  • אימון הוראות למאמרים

    כוונון עדין של מודלי שפה להבנת טקסטים מחקריים וחילוץ נתונים מדעיים.

  • מענה על שאלות ביו-רפואיות

    פיתוח מערכות מומחה שמסוגלות לענות על שאלות מורכבות מתוך מאמרים רפואיים.

  • חילוץ ישויות כימיות וגנטיות

    זיהוי אוטומטי של חומרים, חלבונים ומונחים מורכבים מתוך פסקאות מדעיות.

איפה זה נופל

הטקסטים כולם באנגלית בלבד ואין כאן נתונים בעברית או בשפות אחרות. מעבר לזה, המאגר מבוסס כולו על עיבוד מחדש של דאטהסטים קודמים, חלקם משנת 2004, ולכן הוא סוחב איתו את ההטיות, השגיאות והמגבלות של כל מקור ומקור. הבעיה המרכזית בפיתוח מוצר מסחרי היא סלט הרישיונות של מקורות המידע. למרות שהמאגר מוגדר ברישיון פתוח, חלק ממקורות המקור שלו מחזיקים רישיונות לא מסחריים כמו CC BY-NC או רישיונות מדביקים כמו GPL 3.0 ו־CC BY-SA, וחלקם חסרי רישיון מוגדר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא באופן גורף. המאגר עצמו מוגדר תחת ODC-By, אבל משימות רבות בתוכו נלקחו ממקורות עם רישיונות אוסרי מסחר כמו CC BY-NC או רישיונות תובעניים כמו GPL 3.0. אם בונים מודל מסחרי, צריך לסנן החוצה את המשימות האלו לפי טבלת הרישיונות המצורפת.

האם יש במאגר תמיכה בעברית?

לא. כל הנתונים, המאמרים וההוראות כתובים באנגלית בלבד. אם אתם עובדים על ספרות רפואית או מדעית בעברית, תצטרכו לתרגם את הנתונים או לייצר דאטהסט ייעודי משלכם.

איך הנתונים נאספו והורכבו?

יוצרי המאגר לא אספו טקסטים חדשים מהרשת, אלא לקחו 54 דאטהסטים קיימים של הבנת ספרות מדעית והמירו אותם לתבנית אחידה של מעקב אחר הוראות. חלק ניכר מהנתונים הביו-רפואיים נלקח ישירות מפרויקט BigBio הקיים.

באיזו תצורת חלון הקשר כדאי להשתמש?

המאגר מגיע בשלוש תצורות של 4096, 8192 ו־16384 טוקנים. החוקרים עצמם ביצעו את כל הניסויים שלהם על גרסת ה־4096, כך שזו נקודת הפתיחה המומלצת אלא אם המודל שלכם דורש במפורש הקשר ארוך במיוחד.

איך טוענים

טוענים את הנתונים דרך ספריית datasets בפייתון ישירות מהמאגר ללא צורך באישור גישה מראש. המאגר מציע שלוש תצורות חלוקה לפי אורך הקשר מרבי של 4096, 8192 ו־16384 טוקנים, בקבצי Parquet. השדות המרכזיים לעבודה הם input שמחזיק את הודעת המשתמש, output לתשובה הרצויה, ושדה metadata שמכיל את סיווג המשימה והתחום המדעי. מי שמתכנן אימון בפועל צריך לפנות לדאטהסט המשוערך שהחוקרים פרסמו בנפרד בשם SciRIFF train mix.

from datasets import load_dataset

ds = load_dataset("allenai/SciRIFF")

הרישיון

המאגר עצמו מופץ תחת רישיון ODC-By, שמתיר שימוש מסחרי ושינוי בתנאי שנותנים ייחוס הולם ליוצרים. עם זאת, הדאטהסט נגזר מעשרות מקורות שחלקם מוגנים ברישיונות מגבילים יותר כמו GPL 3.0 ו־CC BY-NC שלא מאפשרים שימוש מסחרי. אימון מודל עלול לחשוף אתכם להפרת תנאי המקור, כך שחובה לסנן ידנית את המשימות לפי טבלת המקורות לפני שימוש מסחרי.

הרישיון המלא ב־Hugging Face ↗