GPT
P

prot_bert

קוד פתוח

Rostlabרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • fill-mask
  • protein language model
  • protein

זהו מודל שפה שמנתח רצפי חלבונים במקום טקסט אנושי. הוא מחלץ מאפיינים ביופיזיקליים ומנחש חומצות אמינו חסרות ישירות מתוך הרצף הגולמי.

  • 40,000טוקנים בהקשר
  • 1.6 GBמשקל הקבצים
  • 48,357הורדות בחודש
  • 136לייקים

מה זה

הארכיטקטורה מבוססת על ברט עם שלושים שכבות, אבל כאן המילים הן חומצות אמינו. המודל אומן על מאגר ענק של 217 מיליון רצפי חלבונים ללא תיוג ידני, במשימה של השלמת מקטעים מוסתרים. בניגוד למודלי שפה רגילים, אין כאן חיזוי של המשפט הבא, כי כל רצף חלבון נחשב ליחידה עצמאית שלמה.

המטרה העיקרית שלו היא להמיר רצף ביולוגי לוקטורים שמייצגים את המבנה והתכונות של החלבון. המפתחים בדקו אותו במשימות ביולוגיות ספציפיות כמו חיזוי מבנה שניוני, שבו הוא הגיע לדיוק של 81 עד 83 אחוזים במבחני הערכה מוכרים, וחיזוי מיקום תוך תאי עם 79 אחוזי דיוק. התוצאות מראות שהייצוגים שלו קולטים עקרונות פיזיקליים אמיתיים ולא רק התאמות סטטיסטיות שטחיות.

מתאים ל

  • הפקת מאפיינים לחלבון

    יצירת וקטורים שמייצגים את המבנה הפיזיקלי של הרצף לצורך אימון מודלים קלים.

  • השלמת מקטעים ברצף

    ניחוש חומצות אמינו חסרות או מוטציות אפשריות בעזרת מנגנון מיסוך הטוקנים.

  • חיזוי מבנה שניוני

    בסיס לאימון מודל המשך שמזהה קיפולים ומבנים מרחביים של חלבונים בדיוק מוכח.

איפה זה נופל

יש לו דרישות קלט קשיחות מאוד שמחייבות הכנה ידנית מקדימה. הוא מקבל אותיות גדולות בלבד, מחייב רווח בין כל חומצת אמינו, ודורש החלפה מפורשת של חומצות אמינו נדירות לאות מסוימת לפני ההזנה. אם תכניסו טקסט לא מעובד, תקבלו תוצאות שגויות.

בנוסף, החוקרים ציינו במפורש שבמשימות רבות הפקת וקטורים קבועים אינה מספיקה, ותצטרכו לאמן את המודל מחדש על הדאטה הספציפי שלכם כדי להגיע לרמת דיוק סבירה.

שאלות
נפוצות

האם אפשר להעביר לו מחרוזת חלבון רגילה כמו שהיא?

לא. המודל דורש אותיות גדולות בלבד עם רווח בין כל אות, והחלפה ידנית מראש של האותיות U, Z, O ו־B באות X.

האם כדאי להשתמש בו ישירות או לאמן אותו הלאה?

החוקרים מציינים שברוב משימות היעד תקבלו ביצועים טובים בהרבה אם תאמנו שכבות עליונות על המשימה שלכם, במקום רק לשלוף וקטורים.

איך מריצים

המודל שוקל 1.6 גיגה בייט בלבד, כך שלא צריך שרת מפלצתי בשביל להריץ אותו. כרטיס מסך ביתי מודרני עם שמונה גיגה זיכרון יספיק בקלות להרצת חיזויים והפקת וקטורים באמצעות ספריית טרנספורמרס בסיסית בפייתון.

האימון המקורי התבצע על חומרת טי פי יו באורכים של עד 2048 חומצות אמינו. בגלל המשקל הנמוך, אין שום סיבה לשלם לספקי שירות ענן חיצוניים על קריאות שרת, אלא פשוט להוריד את הקבצים ולהריץ את התהליך לוקאלית.

from transformers import pipeline

pipe = pipeline("fill-mask", model="Rostlab/prot_bert")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 1.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

החוקרים שפרסמו את המשקלים לא צירפו רישיון שימוש מוגדר. במצב כזה, מבחינה משפטית אין היתר ברור לשימוש מסחרי, וכל שילוב שלו במוצר עסקי חושף אתכם לסיכון של הפרת זכויות יוצרים עד לבירור מול היוצרים.

הרישיון המלא בעמוד המודל ↗