GPT
T

Tahoe-100M

קוד פתוח

tahoebiocc0-1.02025-03-12

  • biology
  • single-cell
  • RNA
  • chemistry

מעל מאה מיליון פרופילים של תא בודד מחמישים שורות תאים סרטניים שנחשפו לאלף ומאה תרופות ומולקולות קטנות. זה המאגר הכי גדול שקיים למי שמפתח מודלים של ביולוגיה תאית ותגובות תרופתיות.

  • 55,809הורדות בחודש
  • 124לייקים

מה זה

כל שורה במאגר מייצגת תא בודד ומכילה ספירות ביטוי גנטי גולמיות עבור גנים שאינם מאופסים, לצד מזהי גנים כמספרים שלמים. בנוסף לביטוי הגנטי, כל תא מקושר לשם התרופה שנבדקה, מזהה שורת התא, מחרוזת המבנה הכימי במבנה סמיילס, ומנגנון הפעולה של החומר.

הנתונים נאספו באמצעות מערכת הניסוי של חברת ובו תרפיוטיקס מתרביות תלת־ממדיות של חמישים שורות תאים סרטניים, שטופלו על גבי 14 פלטות מעבדה בתרכובות שונות ובבקרות של החומר הממיס. פרטי הסינון לא מפורטים בכרטיס, אך מוצגים מדדי איכות ממוצעים לכל דגימה כמו ספירת תעתיקים ואחוז קריאות ממיטוכונדריה.

המאגר מחולק לטבלה הראשית המכילה את נתוני הביטוי, ולמספר טבלאות מטא־דאטה נפרדות. הטבלאות המשלימות מקשרות בין מספרי הגנים לשמות המקובלים, מפרטות מוטציות גנטיות של שורות התאים, ומוסיפות מידע קליני וכימי על התרופות.

מתאים ל

  • אימון מודלי יסוד לתא

    למידת ייצוגים של ביטוי גנטי והשפעות כימיות על תאים בממדי ענק.

  • חיזוי תגובה לתרופות

    בניית מודלים שמנבאים כיצד שורת תא סרטני ספציפית תגיב למולקולה קטנה חדשה.

  • גילוי מנגנוני פעולה

    זיהוי מסלולים ביולוגיים ושינויים בתפקוד גנים בעקבות חשיפה לתרכובות שונות.

איפה זה נופל

חלק משמעותי מנתוני המטא־דאטה על התרופות, כולל מנגנוני הפעולה, מטרות מולקולריות ואישורי שימוש קליני, נוצר או סווג בעזרת מודל שפה ולא אומת ידנית במלואו. המאגר מוגבל אך ורק לחמישים שורות תאים סרטניות ספציפיות, כך שאינו מייצג תאים בריאים או רקמות מגוונות. קיימת שונות טכנית בין 14 הפלטות השונות שמחייבת התחשבות בבקרות תואמות פלטה כדי למנוע הטיות מדידה. בנוסף, מזהי החומרים בבקרות מכילים מחרוזות ריקות שדורשות המרה ידנית לפני שליפה ממסדי נתונים חיצוניים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא נחלת הכלל ואינו מטיל שום הגבלה על שימוש מסחרי, הפצה או פיתוח מודלים סגורים. אתם לא נדרשים לפרסם את התוצרים שלכם תחת רישיון פתוח.

כמה שוקל הדאטהסט ואיך מורידים אותו?

המאגר כולל אלפי קובצי פארקט ומכיל מעל מאה מיליון רשומות, כך שמדובר בנפח של מאות גיגה־בייטים עד טרה־בייטים. הדרך המעשית לעבוד איתו היא הזרמה בסטרימינג ישירות מהקוד, או שימוש בקובצי אנדאטה ייעודיים שנבנו על ידי הקהילה.

האם יש במאגר נתונים בעברית או טקסט חופשי?

לא, המאגר הוא ביולוגי־כימי ומכיל בעיקר מטריצות של ספירות ביטוי גנים, מזהים מספריים ומחרוזות מבנה כימי. הטקסט היחיד הוא שמות התרופות והערות קצרות באנגלית על אישורים קליניים.

האם אפשר לסמוך על סיווג מנגנוני הפעולה של התרופות?

יש לבדוק אותם בזהירות, מכיוון שהסיווגים והמטרות המולקולריות הופקו או הושלמו בעזרת מודל שפה ולא כולם נבדקו ניסויית במחקר הנוכחי. עבור משימות קריטיות כדאי להצליב את המזהים עם מאגרים חיצוניים באמצעות מזהה פבכם.

איך טוענים

טוענים את המאגר ישירות בעזרת הספרייה הפייתונית עם הגדרת סטרימינג כדי לא להוריד הכל מראש, כי המאגר מחולק לאלפי קובצי פארקט ודורש נפח אחסון עצום. הגישה פתוחה לחלוטין וללא צורך באישור. שימו לב שהאיבר הראשון ברשימת הגנים והביטויים הוא טוקן סימון טכני שיש להסיר בעיבוד, ושהמרת מזהי הגנים לשמות מחייבת הצלבה עם טבלת המטא־דאטה של הגנים.

from datasets import load_dataset

ds = load_dataset("tahoebio/Tahoe-100M")

הרישיון

המאגר שוחרר ברישיון נחלת הכלל, מה שאומר שאין עליו מגבלות זכויות יוצרים כלל. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, ולאמן עליו מודלים פנימיים או מסחריים בלי חובת ייחוס ובלי דרישה לשתף את הקוד או את הנגזרות באותו אופן.

הרישיון המלא ב־Hugging Face ↗