GPT
E

ESMFold2

קוד פתוח

biohubmit2026-05-13

  • transformers
  • safetensors
  • esmfold2
  • biology
  • esm

חיזוי מבנה תלת-ממדי של חלבונים, דנ"א ומולקולות קטנות ישירות מרצף חומצות אמינו. מיועד למי שצריך דיוק שמגיע לרמה של אלפאפולד 3 אבל רוצה משקל קל של 1.3 גיגה-בייט והרצה עצמאית.

  • 235Mפרמטרים
  • 1.3 GBמשקל הקבצים
  • 363,718הורדות בחודש
  • 56לייקים

מה זה

המודל מחשב קואורדינטות תלת-ממדיות ברמת כלל האטומים ישירות מרצף, ומספק גם מדדי ביטחון כמו pLDDT ו־pTM. בניגוד לגרסה המקורית של הכלי, כאן יש תמיכה במגוון ביו-מולקולות, כולל מולקולות קטנות, דנ"א, רנ"א וחומצות אמינו שעברו שינוי. הוא מציע שתי דרכי עבודה, חיזוי ישיר מרצף בודד או שימוש ביישור רצפים מרובה, שמשפר את התוצאה במקרים מורכבים.

במבחני FoldBench ובמדד Runs N' Poses, המודל משתווה או עוקף את הביצועים של AlphaFold3 בחיזוי קומפלקסים של נוגדן-אנטיגן וחלבון-חלבון. הגדלת חישובי ההסקה בזמן ריצה משפרת את הדיוק בפועל, במיוחד על נוגדנים, כך שיש לכם שליטה על הטרייד-אוף בין זמן עיבוד לרמת הפירוט.

מתאים ל

  • חיזוי קומפלקס נוגדן-אנטיגן

    משיג דיוק שמשתווה ל־AlphaFold3 באמצעות הקצאת חישוב בזמן הסקה והזנת יישור רצפים כפול.

  • מידול חלבון עם מולקולה קטנה

    מאפשר לחזות במקביל את שלד החלבון יחד עם קו-פקטורים, דנ"א וליגנדים באותו תהליך חישוב.

  • סריקה מהירה מרצף בודד

    משתמש בגרסת Fast הקלה כדי לקבל הערכת מבנה ומדדי ביטחון במהירות בלי לבנות יישור רצפים.

איפה זה נופל

האימון נשען על מאגרי PDB ו־AlphaFold DB עם נקודת חיתוך של ספטמבר 2021, ולכן יש הטיה מובנית למשפחות חלבונים ספציפיות וביצועים פחות טובים על מולקולות נדירות, אזורים חסרי סדר או מצבי קונפורמציה חסרים. בנוסף, תוצאות ברמת דיוק מקסימלית תלויות בהקצאה של משאבי חישוב כבדים בזמן ההסקה, והרצה עם פרמטרים מופחתים תפגע באיכות המבנה. כל פלט הוא רק השערה חישובית ולא מחליף אימות ניסויי בקריסטלוגרפיה או מיקרוסקופיה אלקטרונית.

שאלות
נפוצות

מה ההבדל בין הגרסה הרגילה לגרסת Fast?

הגרסה הרגילה תומכת ביישור רצפים מרובה, שזה קריטי לדיוק גבוה בקומפלקסים מורכבים של חלבונים. גרסת ה־Fast מותאמת להסקה מהירה על בסיס רצף בודד בלבד, בלי התחשבות במידע אבולוציוני חיצוני.

האם המודל יודע לחזות מבנים של רנ"א וחומצות אמינו מיוחדות?

כן, בניגוד לגרסה הראשונה של הכלי שהתמקדה בחלבונים בלבד, כאן הוסיפו תמיכה במולקולות קטנות, דנ"א, רנ"א ושיירים שעברו מודיפיקציות. הוא מפיק קואורדינטות מלאות לכל האטומים של המולקולות האלו.

למה כדאי להשתמש ב־API במקום להריץ עצמאית?

אמנם המודל שוקל רק 1.3 גיגה-בייט, אבל דיוק מרבי על מטרות קשות דורש הגדלה של כמות הצעדים והלולאות בזמן הריצה. אם אין לכם מעבדים גרפיים חזקים להרצות כבדות, פנייה לשרת חיצוני חוסכת את צוואר הבקבוק.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.3 גיגה-בייט בלבד עם 235 מיליון פרמטרים, מה שאומר שכרטיס מסך ביתי בודד עם זיכרון צנוע יריץ אותו בלי מאמץ מיוחד דרך ספריית esm בגיטהאב. בקוד פשוט טוענים אותו ישירות לכרטיס עם קריאה ל־infer_protein ומגדירים את כמות הדגימות והלולאות שרוצים להקצות לחישוב.

יש שתי גרסאות בחבילה. הגרסה הרגילה תומכת בהזנת יישור רצפים כדי לפצח מבנים קשים, והגרסה המהירה מיועדת לרצף בודד בלבד וחוסכת זמני עיבוד. אם אתם לא רוצים להחזיק שרת ייעודי או מתמודדים עם תורים ארוכים של עיבודים כבדים, אפשר לפנות ישירות ל־API של החברה במקום לנהל את התשתית בעצמכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="biohub/ESMFold2")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 1.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ ברישיון MIT חופשי לחלוטין. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהטמיע אותו במוצרים סגורים בלי תשלום תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗