GPT
G

Geneformer

קוד פתוח

ctheodorisapache-2.02022-03-12

  • transformers
  • safetensors
  • bert
  • fill-mask
  • single-cell

מודל שפת ביולוגי שלומד ביטוי גנים מתאי אדם בודדים, בלי להסתמך על תוויות. הוא מיועד לחיזוי השפעות של מחיקת גנים וטיפולים בלי לעבור קודם במעבדה רטובה.

  • 316Mפרמטרים
  • 4,096טוקנים בהקשר
  • 3.3 GBמשקל הקבצים
  • 1,698הורדות בחודש

מה זה

במקום טקסט רגיל, המודל הזה מקבל פרופיל ביטוי גנים של תא בודד כרשימה מדורגת. הגנים מסודרים לפי רמת הביטוי שלהם באותו תא בהשוואה לכלל הנתונים שעליהם הוא אומן, שיטה שמנטרלת גנים בסיסיים שקיימים בכל תא ומבליטה גנים כמו גורמי שעתוק שמגדירים את מצב התא בפועל.

האימון נעשה במתכונת של מסכוך, בדומה למודלי שפה מוכרים. המודל מסתיר כחמישה עשר אחוזים מהגנים בכל תא ומנחש אילו גנים אמורים להופיע שם על בסיס ההקשר של שאר הגנים. היכולת הזו מאפשרת להשתמש בו ישירות לניתוחי אפס דוגמאות או לאמן אותו נקודתית על כמויות דאטה קטנות לצורכי סיווג תאים וגילוי מטרות תרופתיות.

מתאים ל

  • הפרעות גנטיות במחשב

    סימולציה של השתקת גורמי שעתוק כדי לבדוק איך מצב התא משתנה בלי לבצע ניסויים ידניים יקרים.

  • סיווג תאים ומחלות

    אימון המודל על נתונים קיימים כדי לקבוע סוג תא מדויק או לזהות מצבי מחלה מתוך דגימות בודדות.

  • איתור מטרות טיפוליות

    ניתוח מסלולים מולקולריים בחולים במטרה לגלות חלבונים שיכולים לשמש יעד לתרופות חדשות.

איפה זה נופל

המודל אומן מראש אך ורק על תאים אנושיים בריאים, והחוקרים הוציאו מהאימון המקורי תאים ממאירים כדי למנוע רעש ברשתות הגנטיות. אם המחקר שלכם מתמקד בסרטן, המודל הראשי לא יתאים ותצטרכו לפנות לגרסה הנפרדת שאומנה על תאי גידול. בנוסף, הוא דורש כוונון ידני של היפרפרמטרים לכל משימה ספציפית, ואין ערכי ברירת מחדל שמתאימים לכל תרחיש.

שאלות
נפוצות

האם המודל יודע לקרוא טקסט מדעי או מחקרים?

לא. הוא מבוסס על מבנה של מודל שפה, אבל אוצר המילים שלו מורכב אך ורק מכעשרים אלף גנים שמקודדים לחלבונים.

האם אפשר להריץ אותו ישר על טבלאות ספירה רגילות?

לא ישירות. צריך להשתמש בסקריפטים שבתוך המאגר כדי להמיר את ספירות הטרנסקריפטום לדירוג יחסי לפני שהמודל מסוגל לקרוא אותם.

איך מריצים

המשקל של המודל עומד על כ־3.3 ג'יגה־בייט בפורמט צף רגיל, מה שאומר שהוא נכנס בקלות לכרטיס מסך ביתי בסיסי. ההרצה דורשת התקנה של המאגר המקומי שכולל סקריפטים ייעודיים לקידוד התאים וטוקניזציה לפני ההזנה למודל.

המפתחים מציינים במפורש שחובה להשתמש במאיץ גרפי כדי לעבוד איתו ביעילות. ברירת המחדל כאן היא גרסת 316 מיליון פרמטרים, אבל במאגר יש גם גרסאות קטנות יותר של 10 מיליון ו־104 מיליון פרמטרים, וכן גרסה מותאמת לתאי סרטן. אין שירות ענן רשמי שמוכר גישה דרך ממשק פשוט, אז תצטרכו להרים אותו מקומית או על שרת ייעודי.

from transformers import pipeline

pipe = pipeline("fill-mask", model="ctheodoris/Geneformer")
print(pipe("שלום"))

הקבצים

87 קבצים במאגר, 3.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים פנימיים, לשנות אותו ולשלב אותו במוצרים מסחריים בלי לשלם תמלוגים, כל עוד שומרים על הודעות זכויות היוצרים והרישיון המקורי של המחברים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗