GPT
C

chemprot

קוד פתוח

bigbioother2022-11-13

מאגר שמסמן חלבונים, חומרים כימיים ואת הקשרים ביניהם מתוך ספרות רפואית. הוא מיועד למי שרוצה לאמן מודלים לזיהוי ישויות וחילוץ יחסים מדעיים מורכבים.

  • 4,359הורדות בחודש
  • 16לייקים

מה זה

הנתונים מגיעים ישירות מתחרות BioCreative VI, מתוך מאמרים מדעיים שפורסמו במאגר PubMed. הם נועדו לאמן מודלים לזהות מתי תרכובת כימית פועלת על חלבון מסוים, למשל בתור מעכבת או משפעלת, ולקבוע מה בדיוק אופי האינטראקציה ביניהם.

בתוך המאגר תמצאו שתי תצורות עבודה עיקריות של אותם נתונים. התצורה הראשונה מנגישה את המידע המקורי של התחרות, והשנייה מביאה אותו במבנה אחיד של פרויקט BigBio. החלוקה הפנימית מסודרת כבר לקבוצות אימון, בדיקה, אימות ודגימה, כשבכל רשומה מסומנות הישויות של החלבונים והכימיקלים לצד היחסים שנמצאו ביניהם על פני הטקסט.

מתאים ל

  • חילוץ קשרים בין חומרים

    זיהוי יחסים ביולוגיים בין חומר כימי לחלבון מטרה, כמו אגוניסט או אנטגוניסט.

  • זיהוי ישויות ביו רפואיות

    איתור שמות של כימיקלים וחלבונים בתוך פסקאות מדעיות ומאמרי רפואה.

  • בדיקת ביצועים למודלי שפה

    הערכת היכולת של מודל להתמודד עם הבנת הנקרא וסיווג יחסים בטקסט מדעי.

איפה זה נופל

כל הטקסטים נלקחו ממאמרים מחקריים באנגלית ומנוסחים בשפה ביו רפואית כבדה, כך שאין כאן שום ייצוג לעברית או לניסוחים יומיומיים. מדובר בנתונים שהתפרסמו סביב שנת 2017, והכרטיס לא מפרט אילו הטיות קיימות בבחירת המאמרים או מה גודל המדגם המדויק. מי שבונה מוצר קליני או מסחרי יצטרך לבדוק בעצמו אם הסימונים תואמים לידע רפואי עדכני.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון המדווח הוא רישיון כללי מסוג אחר, והכרטיס לא מספק פרטים מדויקים. המאגר מכיל תקצירים של מאמרים מדעיים מתוך PubMed, ולכן חובה להיכנס לאתר התחרות המקורית כדי לוודא אם תנאי השימוש מאפשרים הטמעה מסחרית. אל תניחו שמותר להשתמש בו בחופשיות בלי לבדוק את זה.

האם יש במאגר טקסטים בעברית?

לא, כל הנתונים מבוססים על ספרות מדעית שנכתבה באנגלית בלבד. המאגר לא מתאים לאימון מודלים שמיועדים לעבד עברית רפואית. אם אתם עובדים על מערכת מקומית, תצטרכו לתרגם את הנתונים או לחפש מקור מקומי.

איך נאספו הנתונים שבמאגר?

הטקסטים נאספו במסגרת תחרות BioCreative VI מתוך מאגר המחקרים PubMed. המארגנים תייגו ידנית שמות של חומרים כימיים וחלבונים, והגדירו את סוגי האינטראקציות ביניהם. מדובר בסימונים מומחים שנועדו לבחון יכולות חילוץ מידע אוטומטי.

האם המאגר דורש הרשמה או אישור גישה?

אין צורך בהרשמה מוקדמת או בקבלת אישור מיוחד כדי להוריד את הקבצים. המאגר פתוח לציבור וניתן למשוך אותו ישירות בקוד דרך ספריית הדאטהסטים. הוא זמין כקובצי פרקט שמחולקים כבר לקבוצות אימון ובדיקה.

איך טוענים

טוענים את המאגר ישירות דרך ספריית הדאטהסטים באמצעות המזהה הרשמי, ללא צורך בבקשת גישה מיוחדת או אישור מראש. הנתונים שמורים בקובצי פרקט ומחולקים לפי תצורות, כמו המבנה הרגיל או הפורמט של BigBio. מומלץ לבחור מראש את הקונפיגורציה שמתאימה לצינור העבודה שלכם כדי לשלוף את השדות הרלוונטיים לישויות ולקשרים ביניהן.

from datasets import load_dataset

ds = load_dataset("bigbio/chemprot")

הרישיון

הרישיון מוגדר כמותאם אישית ולא כרישיון קוד פתוח סטנדרטי. הכרטיס אינו מפרט מה תנאי השימוש, האם מותר להשתמש במידע במוצרים מסחריים ומה הכללים לגבי מודלים שאומנו עליו. כדי לא להסתבך משפטית, חובה לגשת למקור של תחרות BioCreative VI ולבדוק את תנאי הרישיון המקוריים של המאמרים לפני כל עבודה מסחרית.

הרישיון המלא ב־Hugging Face ↗