GPT
D

DNABERT-2-117M

קוד פתוח

zhihan1996רישיון לא דווח2023-06-26

  • transformers
  • pytorch
  • biology
  • medical
  • genomics

מודל בסיס קטן שמיועד לניתוח רצפי דנא מרובי זנים במקום טקסט רגיל. הוא מוציא ייצוגים וקטוריים מדויקים מרצפים גנטיים בלי לדרוש משאבי ענק.

  • 512טוקנים בהקשר
  • 447 MBמשקל הקבצים
  • 1,221,039הורדות בחודש
  • 112לייקים

מה זה

המודל הזה נבנה על בסיס הארכיטקטורה של MosaicBERT ועבר אימון ייעודי על רצפי גנום של מגוון אורגניזמים. במקום לקרוא מילים באנגלית או בעברית, הוא מקבל מחרוזות של בסיסים נוקלאוטידיים ומפיק מהם וקטורים שמייצגים תכונות ביולוגיות מורכבות ברמת הרצף.

המשקל שלו קל מאוד ביחס למודלים מודרניים, פחות מחצי ג׳יגהבייט, ועם 12 שכבות הוא מספק נקודת מוצא יעילה לעיבוד רצפים. ההתבססות על תשתית יעילה מאפשרת לו לרוץ מהר, והייעוד הרב זני שלו אומר שהוא לא מוגבל רק לדנא אנושי אלא מכיר דפוסים גנטיים רחבים יותר שנשמרים באבולוציה.

מתאים ל

  • חילוץ וקטורים מדנא

    הפקת ייצוגים מספריים מרצפי נוקלאוטידים קצרים עבור מודלים פשוטים יותר במורד הזרם.

  • סיווג רצפים גנטיים

    בסיס לאימון מודל מהיר שמזהה מאפיינים תפקודיים ברצפים ביולוגיים קצרים.

  • מחקר גנומי השוואתי

    בדיקת דמיון בין מקטעי דנא מזנים שונים על בסיס הייצוגים שהמודל למד באימון.

איפה זה נופל

חלון ההקשר עומד על 512 טוקנים בלבד, מה שמגביל מאוד ניתוח של מקטעים גנומיים ארוכים או אינטראקציות מרוחקות בלי לחתוך את המידע מראש. בנוסף, הטעינה שלו מחייבת הפעלת קוד מרוחק בעת הייבוא, מה שיוצר סיכון אבטחה שחייבים לבדוק ידנית לפני שמריצים אותו בסביבה ארגונית סגורה.

שאלות
נפוצות

אפשר להזין לו טקסט רגיל כדי לחלץ נתונים?

לא, הוא אומן אך ורק על רצפי בסיסים גנטיים כמו אדנין, תימין, גואנין וציטוזין. טקסט רגיל יפיק פלט חסר משמעות.

למה הטעינה דורשת trust_remote_code?

הוא מתבסס על מימוש מותאם של MosaicBERT שלא נמצא בליבה המקורית של ספריית transformers. זה מחייב הרצת קוד צד שלישי מהמאגר, ולכן כדאי לבדוק את הקבצים לפני ההרצה.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers הרגילה בפייתון, עם הדגלים הרגילים של מודל וטוקנייזר. בגלל הגודל המזערי שלו, אפשר להריץ אותו בקלות על כל מעבד מודרני או כרטיס מסך בסיסי בלי לחשוב בכלל על אופטימיזציות מורכבות.

אין שום צורך לשלם על שירותי ענן יקרים או לחפש API חיצוני בשביל 117 מיליון פרמטרים. מורידים את 447 המגהבייט למכונה המקומית, מעבירים רצף נוקלאוטידים, ועושים ממוצע או מקסימום על השכבות האחרונות כדי לקבל את הווקטור הסופי.

from transformers import pipeline

pipe = pipeline("text-generation", model="zhihan1996/DNABERT-2-117M")
print(pipe("שלום"))

הרישיון

היוצר לא הגדיר רישיון רשמי בעמוד המודל. מבחינה משפטית מדובר בשטח אפור, ואסור לשלב אותו במוצר מסחרי או בהפצה חיצונית לפני שפונים ליוצרים ומקבלים אישור מפורש בכתב על תנאי השימוש.

הרישיון המלא בעמוד המודל ↗