GPT
S

STimage-1K4M

קוד פתוח

jiawennnnmit2024-08-10

  • biology

המאגר מחבר תמונות היסטופתולוגיות ברזולוציה גבוהה עם נתוני ביטוי גנים מותאמים מרחבית. הוא מיועד למי שמפתח או מאמן מודלים בתחום הטרנסקריפטומיקה המרחבית וצריך צימוד ישיר בין רקמה לגנטיקה.

  • 4,682הורדות בחודש
  • 31לייקים

מה זה

המאגר כולל 1,149 סליידים של טרנסקריפטומיקה מרחבית ומכיל מעל 4 מיליון נקודות דגימה (spots) שמצומדות לפרופילי ביטוי גנים. הנתונים מחולקים לפי טכנולוגיות המדידה השונות ששימשו לאיסוף: Spatial Transcriptomics הוותיקה יותר, Visium ו־VisiumHD. לכל טכנולוגיה יש תיקיות ייעודיות שמכילות את התמונות, את קובצי ביטוי הגנים ואת קואורדינטות המיקום ורדיוס הנקודות על גבי הרקמה.

בנוסף למידע הגולמי, המאגר מספק תיקיית אנוטציות של פתולוגים ותיקיית מטא-דאטה. תיקיית המטא מכילה קובצי ביבליוגרפיה של המחקרים מהם נאספו הדגימות, וכן קובץ מטא-דאטה מרוכז לכלל הגנים, שעודכן בפברואר 2025 כדי לתקן שיוך שגוי של דגימות מוח וכליה בין אדם לעכבר.

מתאים ל

  • סגמנטציה של רקמות

    זיהוי וחלוקה של אזורי רקמה בתמונות היסטופתולוגיות באמצעות האנוטציות של הפתולוגים.

  • מיצוי תכונות מתמונה

    אימון מודלים להפקת ייצוגים ויזואליים מרקמות וקישורם לרמות ביטוי של גנים ספציפיים.

  • סיווג פתולוגי

    בניית מסווגים לתמונות מיקרוסקופיות המבוססים על ההתאמה בין מבנה הרקמה לפרופיל הגנטי.

איפה זה נופל

הכרטיס לא מפרט אילו סוגי רקמות או מחלות כלולים במדגם מעבר לתיקון הנקודתי של מוח וכליה בעכבר מול אדם, מה שמחייב בדיקה ידנית של קובצי המטא לפני שמניחים התאמה לבעיה ספציפית. בנוסף, הנתונים מגיעים משלוש טכנולוגיות שונות ברזולוציות שונות, כך שיש שונות טכנית משמעותית בין הדגימות. הטקסטים והמטא-דאטה מנוהלים באנגלית בלבד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא MIT ולכן מותר להשתמש בנתונים לפיתוח מסחרי. יש לוודא ששומרים על תנאי הייחוס של הרישיון בעת השימוש. אם מסתמכים על דגימות ממחקרים ספציפיים, מומלץ לבדוק גם את המקורות המופיעים בקובץ הביבליוגרפיה.

האם יש במאגר תמיכה או נתונים בעברית?

לא, המאגר מוגדר כולו באנגלית. קובצי המטא-דאטה, שמות הגנים וההערות מנוהלים באנגלית בלבד. אין בו שום תוכן טקסטואלי או קליני בעברית.

איך הנתונים מאורגנים ומאיפה הם נאספו?

הנתונים מאורגנים לפי שלוש טכנולוגיות שונות: ST, Visium ו־VisiumHD. המקורות נאספו ממחקרים קודמים שפורסמו ומרוכזים בקובץ ביבליוגרפיה לפי מזהי תפיסה ביולוגיים כמו GSE ו־GSM. לכל דגימה יש קובץ תמונה, קובץ קואורדינטות של הנקודות וקובץ ביטוי גנים תואם.

איך טוענים

הנתונים יושבים במאגר שמכיל 3,524 קבצים ולא דורש אישור גישה מיוחד. המבנה מבוסס על קובצי תמונה ולצידם קובצי CSV נפרדים לקואורדינטות ולביטוי הגנים, כמו למשל קובצי GSE ו־GSM בתיקיות הקואורדינטות. בעבודה איתו צריך לטעון את קובץ המטא המעודכן meta_all_gene02122025.csv כדי לקשר נכון בין התמונות לנתונים הגנטיים.

from datasets import load_dataset

ds = load_dataset("jiawennnn/STimage-1K4M")

הרישיון

המאגר מדווח תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי ומחקר חופשי, ומאפשר לאמן מודלים ללא דרישה להפיץ את התוצרים באותו רישיון. החובה העיקרית היא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקוד ובקבצים שמופצים הלאה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗