GPT
X

X-Atlas-Orion

קוד פתוח

Xaira-Therapeuticscc-by-nc-sa-4.02025-07-16

מאגר נתוני Perturb-seq של שמונה מיליון תאים שממפים השתקת 18,903 גנים אנושיים ברמת תא בודד. הוא נבנה ישירות לאימון מודלי יסוד בביולוגיה שצריכים להבין אפקטים של מינון גנטי.

  • 37,816הורדות בחודש
  • 28לייקים

מה זה

המאגר מכיל שמונה מיליון תאים משני קווי תאים אנושיים, HCT116 ו־HEK293T, שנבדקו באמצעות שיטת FiCS Perturb-seq שמכסה את כל הגנים מקודדי החלבון באדם, סך הכל 18,903 גנים. הרצוף עמוק ומגיע לחציון של 16,000 מולקולות ייחודיות לתא, עם לפחות 140 תאים לכל התערבות גנטית.

הנתונים מיושרים לגנום הייחוס GRCh38 של 10x Genomics מגרסת 2024-A. כל רשומה כוללת ביטוי גנים גולמי ומזהי טוקנים לגנים שבוטאו, לצד מזהה הברקוד של התא, אצווה, מספר המדריכים הגנטיים, מטרת הגן, מדדי ספירה כוללים וספירות מיטוכונדריאליות. קיים גם שדה בוליאני שמסמן אם התא עבר סינון התאמה של צמד מדריכים.

מתאים ל

  • אימון מודלי יסוד ביולוגיים

    לימוד ייצוגים של תגובות תאיות להשתקת גנים בהיקף גנומי רחב עם תלות במינון.

  • ניתוח מסלולים גנטיים

    בדיקת ההשפעה של נוק-דאון בגנים ספציפיים על ביטוי שאר הגנים בתא.

  • ולידציה של ניסויי CRISPR

    השוואת תוצאות מעבדה מקומיות לפרופילי ביטוי גנטי שנמדדו בעומק רצוף גבוה.

איפה זה נופל

ההשתקה הגנטית לא אחידה בין הדגימות. יעילות ההשתקה החציונית עומדת על 75.4% בתאי HCT116 וצונחת ל־51.5% בלבד בתאי HEK293T, פער שחובה לקחת בחשבון כשמאמנים מודל על שני הקווים יחד. מעבר לזה, המאגר מוגבל לשני קווי תאים בלבד, כך שאי אפשר להשליך ממנו ישירות על רקמות מורכבות או סוגי תאים אחרים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא CC BY-NC-SA 4.0, מה שאוסר כל שימוש מסחרי בנתונים. אם תאמנו עליו מודל ותפיצו אותו, תחויבו ברישיון זהה ולא תוכלו למכור אותו.

אילו קווי תאים נבדקו בניסוי?

המאגר מכסה שני קווי תאים בלבד, HCT116 ו־HEK293T. כל קו תאים זמין כחלוקה נפרדת בטעינת הנתונים.

איך מחברים בין מזהי הטוקנים לשמות הגנים האמיתיים?

המאגר כולל פיצול מיוחד בשם gene_metadata. הוא מכיל טבלת התאמה בין מזהה הטוקן לבין שם הגן הרשמי ומזהה Ensembl המקביל מגרסת GRCh38.

איך טוענים

הנתונים מחולקים ל־337 קבצים בפורמט Parquet, שכוללים אצוות שונות וקובצי מטא-דאטה למיפוי מזהי גנים לסמלים רשמיים ו־Ensembl ID. הטעינה נעשית ישירות דרך ספריית datasets, וכדאי לעבוד במצב streaming כדי לא להעמיס את הזיכרון. אפשר לטעון ישירות את החלוקה לפי קו התאים, HCT116 או HEK293T, וקובץ נפרד עבור gene_metadata.

from datasets import load_dataset

ds = load_dataset("Xaira-Therapeutics/X-Atlas-Orion")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-sa-4.0. המשמעות ברורה, השימוש מותר למטרות מחקר ומדע בלבד ואסור לחלוטין לשימוש מסחרי. בנוסף, חובה לתת קרדיט ליוצרים, ואם אתם משנים, מעבדים או מאמנים עליו ומפיצים נגזרת, אתם מחויבים להפיץ אותה תחת אותו הרישיון בדיוק. חברות מסחריות לא יכולות להשתמש בו למוצרים מסחריים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗