GPT
N

nucleotide-transformer-2.5b-multi-species

קוד פתוח

InstaDeepAIcc-by-nc-sa-4.02023-04-05

  • transformers
  • pytorch
  • tf
  • joblib
  • esm

מודל שפה שמנתח רצפי דנ"א במקום טקסט אנושי, ואומן על 850 גנומים של אורגניזמים שונים. הוא מתאים לחיזוי פנוטיפים מולקולריים ולהבנת מקטעים גנטיים.

  • 1,002טוקנים בהקשר
  • 27.8 GBמשקל הקבצים
  • 3,568הורדות בחודש
  • 47לייקים

מה זה

במקום ללמוד משפטים באנגלית או קוד, המודל הזה אומן על רצפי נוקלאוטידים גולמיים. הוא משתמש בארכיטקטורת EsmForMaskedLM עם 32 שכבות ופועל במשימת fill-mask בסגנון BERT, שבה הוא מנחש מקטעים מוסתרים בתוך הקוד הגנטי כדי ללמוד את התחביר הביולוגי שלו.

הייחוד בגרסה הזו הוא הדאטה. במקום להסתמך רק על גנום ייחוס אנושי בודד, המפתחים אספו 850 גנומים ממאגר NCBI, מה שסיפק נפח אימון של כ־174 מיליארד נוקלאוטידים. הטוקניזציה חותכת את הדנ"א למקטעים של 6-mers, כך שהמודל מבין צירופים של שישה בסיסים בכל טוקן, באוצר מילים של 4,105 ערכים.

לפי החוקרים, אימון רחב כזה על מגוון יצורים מייצר ייצוגים עמוקים שמספקים דיוק גבוה בחיזוי תכונות מולקולריות. מי שמחפש מודל שמבין ביולוגיה השוואתית ולא רק גנטיקה אנושית צרה, מקבל כאן תשתית רחבה בהרבה מרוב מה שמסתובב ברשת.

מתאים ל

  • חיזוי פנוטיפים מולקולריים

    חילוץ אמבדינגס וחיזוי תכונות ביולוגיות מתוך רצפי דנ"א במגוון יצורים.

  • השלמת מקטעי גנום חסרים

    שימוש במנגנון ה־fill-mask כדי להציע נוקלאוטידים סבירים במקטעים שעברו מיסוך.

  • השוואה גנומית רב-זנית

    הפקת ייצוגים וקטוריים לרצפים ממקורות ביולוגיים שונים באמצעות אותו בסיס.

איפה זה נופל

המודל מוגבל לחלון הקשר קצר של 1,002 טוקנים, שהם בערך 6,000 נוקלאוטידים ברצף מלא. זה לא מספיק לניתוח מקטעים כרומוזומליים ארוכים או להבנת אינטראקציות גנומיות ממרחק רב. בנוסף, האימון החריג לחלוטין צמחים ונגיפים בגלל שוני באלמנטים הרגולטוריים שלהם, כך שהוא פשוט לא רלוונטי לחוקרים בתחומי הבוטניקה והווירולוגיה.

שאלות
נפוצות

האם אפשר להשתמש במודל לניתוח רצפי קורונה או שפעת?

לא. דאטה האימון לא כלל נגיפים או צמחים במכוון, ולכן המודל אינו מכיר את המבנה הרגולטורי שלהם.

כמה נוקלאוטידים אפשר להזין לו בבת אחת?

המגבלה היא 1,000 טוקנים של קלט. מכיוון שהטוקנייזר מקודד לרוב שישיות בסיסים, מדובר בסביבות 6,000 נוקלאוטידים לכל היותר.

האם אפשר להשתמש בו במיזם מסחרי שמפתח תרופות?

הרישיון אוסר שימוש מסחרי מכל סוג. תצטרכו להשתמש בו למחקר אקדמי בלבד או להגיע להסדר מול בעלי הזכויות.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־27.8 גיגה-בייט והמשקולות נשמרות בדיוק float32. זה אומר שכדי לטעון אותו ולהריץ הסקת מסקנות בלי קריסה, תצטרכו כרטיס מסך עם לפחות 32 עד 40 גיגה-בייט של זיכרון גרפי ייעודי, או לחלופין לבצע המרה לדיוק נמוך יותר אם הסביבה תומכת בכך.

ההרצה מתבצעת ישירות דרך ספריית transformers בפייתון או טנזורפלו, אך הכרטיס מציין שיש להתקין את הספרייה ישירות מקוד המקור בגיטהאב. אם אין לכם שרת מקומי עם מאיץ חזק, החזקת מודל בגודל 2.5 מיליארד פרמטרים בזיכרון תעלה לא מעט כסף בענן, ומוטב לשקול שירותי הרצה מנוהלים במידה ואינכם צריכים להריץ אצוות ענק של רצפים באופן קבוע.

from transformers import pipeline

pipe = pipeline("fill-mask", model="InstaDeepAI/nucleotide-transformer-2.5b-multi-species")
print(pipe("שלום"))

הרישיון

הרישיון הוא cc-by-nc-sa-4.0. המשמעות פשוטה: השימוש מותר אך ורק למחקר ולמטרות לא מסחריות. אסור לשלב אותו במוצר שמייצר הכנסה, וכל נגזרת או שינוי שתפרסמו חייבים לשאת בדיוק את אותו הרישיון.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗