GPT
G

Genecorpus-30M

קוד פתוח

ctheodorisapache-2.02022-03-12

המאגר כולל עשרות מיליוני פרופילי ביטוי גנטי מתאים בודדים בבני אדם, שעברו עיבוד ודירוג מיוחד כדי להכשיר מודלי שפה ביולוגיים כמו Geneformer.

  • 1,054הורדות בחודש
  • 86לייקים

מה זה

הנתונים מורכבים מכ־27.4 מיליון תאים בודדים שעברו סינון איכות מתוך 29.9 מיליון שנאספו במקור, ומכסים מגוון רחב של רקמות אנושיות. כל רשומה מייצגת תא בודד ומכילה רשימת מזהים מקודדת לפי סדר ביטוי יחסי, ולא ספירת קריאות רגילה. השיטה מדרגת גנים לפי ביטוי התא ביחס לחציון הכללי של הגן במאגר, מה שמוריד את החשיבות של גנים בסיסיים כמו housekeeping ומבליט גנים שמגדירים את מצב התא.

המקור מגיע מ־561 מאגרי מידע ציבוריים שונים, ביניהם GEO, Human Cell Atlas, 10x Genomics ו־Broad Institute. החוקרים סיננו החוצה תאים שחרגו בשלוש סטיות תקן מסך הקריאות או מהקריאות המיטוכונדריאליות, והסירו תאים שזוהו בהם פחות משבעה גנים רלוונטיים. אין כאן חלוקה מובנית לסט אימון, בדיקה או ולידציה.

מתאים ל

  • אימון מקדים של מודלי שפה

    אימון עצמי של מודלים מבוססי טרנספורמר על רצפי ביטוי גנטי אנושיים להבנת רשתות ויחסי גומלין ביולוגיים.

  • סיווג תאים ומחלות

    כוונון עדין למשימות של זיהוי סוגי תאים או אבחון רקמות חולות באמצעות קובצי הדוגמה המצורפים.

  • זיהוי מטרות טיפוליות

    בחינת שינויים ברשתות בקרה גנטיות לאיתור חלבונים מרכזיים שעשויים לשמש יעדים לתרופות.

איפה זה נופל

המאגר אינו מכיל תאים סרטניים או קווי תאים אלמותיים, שהוצאו במכוון כדי למנוע הטיות עקב מוטציות נרחבות ללא ריצוף גנומי תואם. בנוסף, נכללו רק נתונים שהופקו בטכנולוגיות ריצוף מבוססות טיפות כדי לשמור על אחידות במדידה. רקמות או סוגי תאים מסוימים חסרים פשוט כי לא היו זמינים במאגרים ציבוריים בזמן האיסוף, ואין ברשומות תיוגים מפורשים, כך שהדאטה לא מתאים ישירות ללמידה מונחית בלי מקורות חיצוניים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. רישיון Apache 2.0 מתיר שימוש מסחרי מלא, כולל אימון מודלים סגורים, כל עוד שומרים על הודעת זכויות היוצרים של החוקרים.

איזה סוג מידע יש בכל רשומה?

אין כאן טקסט, אלא רצפי מספרים המייצגים גנים אנושיים המדורגים לפי רמת הביטוי היחסית שלהם בכל תא בודד. המזהים מתורגמים לשמות גנים באמצעות קובץ מילון ייעודי שמצורף לפרויקט.

האם המאגר כולל מידע רפואי רגיש על מטופלים?

לא. הנתונים עברו עיבוד לכדי דירוגי ביטוי ואינם כוללים קריאות ריצוף גולמיות שמאפשרות זיהוי גנטי אישי של התורמים.

האם הנתונים מוכנים למשימות סיווג באופן ישיר?

המאגר הראשי נועד לאימון מקדים ואינו כולל תיוגים של סוגי תאים או מחלות. כדי לבצע משימות סיווג צריך להשתמש בקובצי הדוגמה הספציפיים המצורפים במאגר או להביא תיוגים חיצוניים.

איך טוענים

המידע שמור בפורמט Apache Arrow דרך ספריית Datasets של Hugging Face ואין צורך באישור גישה מיוחד כדי להוריד אותו. כל דוגמה כוללת רק שני שדות: input_ids שמכיל את רצף מזהי הגנים המדורגים, ו־lengths שמציין את אורך הרצף. בנוסף מצורף קובץ pickle בשם token_dictionary.pkl שממפה בין המזהים לבין מזהי Ensembl וטוקנים מיוחדים. המאגר כולל 37 קבצים שונים, בהם גם קובצי דוגמה למיון תאים ומחלות.

from datasets import load_dataset

ds = load_dataset("ctheodoris/Genecorpus-30M")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0 המאפשר שימוש חופשי לחלוטין, כולל אימון מודלים לצרכים מסחריים ופרטיים, ללא חובת שיתוף נגזרות תחת אותו רישיון. נדרש לשמור על הודעות זכויות היוצרים ולתת קרדיט ליוצרים. מודל שאומן על הדאטהסט אינו מחויב ברישיון פתוח.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗