GPT
P

prot_t5_xl_uniref50

קוד פתוח

Rostlabרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • t5
  • text2text-generation
  • protein language model

מודל שפה לחלבונים שלומד את חוקי המבנה הביולוגי מתוך רצפי חומצות אמינו. אם אתם מחלצים ייצוגים למשימות ביואינפורמטיקה, הוא נותן בסיס שנבדק ישירות על חיזוי מבנה.

  • 512טוקנים בהקשר
  • 31.5 GBמשקל הקבצים
  • 190,134הורדות בחודש
  • 63לייקים

מה זה

מדובר במודל שמבוסס על T5-3B עם כמעט 3 מיליארד פרמטרים, שאומן על מאגר UniRef50 שכולל 45 מיליון רצפי חלבונים. בניגוד ל־T5 הרגיל שמשתמש במחיקת מקטעים, כאן אימנו אותו בשיטת מיסוך של 15 אחוז מהטוקנים בדומה ל־BART, מעל נקודת התחלה של ProtT5-XL-BFD. המטרה שלו היא ללמוד תכונות ביופיזיות שקובעות את צורת החלבון ישירות מרצף האותיות.

במבחני ביצועים לחילוץ מאפיינים, הוא מציג דיוק של 81 עד 87 במבנה שניוני בשלושה מצבים על פני CASP12, TS115 ו־CB513. במבנה של שמונה מצבים הוא מגיע לציונים שבין 70 ל־77. במשימות של מיקום תאי וזיהוי חלבוני ממברנה במאגר DeepLoc הוא מוציא 81 ו־91, כך שהווקטורים שהוא מייצר אכן מחזיקים מידע מרחבי ולא רק רצפי.

מתאים ל

  • חילוץ וקטורים לחלבונים

    שליפת ייצוגים מהאנקודר ששומרים על תכונות ביופיזיות ומבנה מרחבי.

  • חיזוי מבנה שניוני

    שימוש בווקטורים המוכנים לזיהוי מבנה של שלושה או שמונה מצבים.

  • סיווג מיקום תוך־תאי

    בניית מודלי קצה לזיהוי חלבוני ממברנה ומיקום בתא על בסיס ציוני DeepLoc.

איפה זה נופל

חלון ההקשר מוגבל ל־512 טוקנים בלבד, וחלבונים ארוכים מזה ייחתכו בתהליך העיבוד. בנוסף, הוא עובד אך ורק עם אותיות גדולות, מחליף חומצות אמינו נדירות כמו U, Z, O ו־B באות X, ורגיש מאוד לצורת הקלט. אם אתם צריכים דיוק גבוה במשימות קצה, היוצרים מציינים שחילוץ מאפיינים בלבד עשוי לא להספיק ותצטרכו לעשות לו כוונון עדין מלא, תהליך שדורש משאבי מחשוב כבדים מאוד בהתחשב בגודלו.

שאלות
נפוצות

האם כדאי להשתמש בדקודר כדי להוציא ייצוגים?

לא. המפתחים מדגישים שעבור חילוץ מאפיינים מקבלים תוצאות טובות יותר ישירות מהאנקודר של המודל.

מה קורה אם הרצף שלי מכיל אותיות קטנות או מעל 512 אותיות?

המודל מאומן רק על אותיות גדולות ולכן אותיות קטנות ישבשו את הפעולה שלו. רצפים שארוכים מ־512 חומצות אמינו ייחתכו וייאבדו מידע.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־31.5 גיגהבייט בתשעה חלקים, כך שצריך חומרה ייעודית רצינית. תצטרכו כרטיס מסך עם זיכרון גדול מאוד, לפחות 32 או 40 גיגהבייט VRAM, רק כדי לטעון אותו ולהריץ הסקת מסקנות בלי לקרוס מחוסר זיכרון.

המפתחים ממליצים במפורש להשתמש באנקודר בלבד כשמחלצים מאפיינים ולא בדקודר. אם אתם בונים שירות ואין לכם שרת מקומי עם מאיץ מתאים, עדיף להריץ את העיבוד דרך תשתית ענן מנוהלת או שירות חיצוני, כי להחזיק מודל כזה חי בזיכרון יעלה לכם לא מעט כסף.

from transformers import pipeline

pipe = pipeline("text-generation", model="Rostlab/prot_t5_xl_uniref50")
print(pipe("שלום"))

הרישיון

הרישיון של המודל לא דווח בדף שלו. מבחינה משפטית זה אומר שאין לכם אישור ברור לשימוש מסחרי, הפצה או הטמעה במוצר סגור. לפני שאתם משלבים אותו בפרויקט עסקי, אתם חייבים לבדוק את הרישיון במאגר המקורי בגיטהאב כדי לא להסתכן בהפרת זכויות.

הרישיון המלא בעמוד המודל ↗