GPT
M

MoLFormer-XL-both-10pct

קוד פתוח

ibm-researchapache-2.02023-10-20

  • transformers
  • safetensors
  • molformer
  • fill-mask
  • chemistry

מודל שפה קטן ויעיל שממיר מחרוזות כימיות של מולקולות קטנות לווקטורים מספריים. הוא מתאים לחיזוי תכונות כימיות וסיווג מולקולות בלי לשרוף משאבי מחשוב כבדים.

  • 47Mפרמטרים
  • 202טוקנים בהקשר
  • 179 MBמשקל הקבצים
  • 101,902הורדות בחודש

מה זה

המודל אומן מראש על עשרה אחוזים ממאגרי המולקולות ZINC ו־PubChem באמצעות ארכיטקטורת שנאי עם קשב לינארי והטמעות מיקום סיבוביות. הוא לוקח ייצוגי טקסט של מולקולות במבנה SMILES ומייצר מהם ייצוג וקטורי דחוס. אפשר להשתמש בו ישירות לחילוץ מאפיינים לצורך מדידת דמיון כימי, או לבצע כוונון עדין למשימות סיווג כמו חיזוי רעילות, מסיסות או חדירות למחסום הדם מוח.

בבדיקות מול מדדי MoleculeNet, הגרסה הזו מגיעה לתוצאות טובות מאוד בסיווג בינארי, למשל ציון שטח מתחת לעקומה של 94.6 במדד ClinTox ו־91.5 במדד BBBP. ברוב משימות הרגרסיה כמו חיזוי תכונות קוונטיות ב־QM9 ו־QM8, גרסת ה־XL המלאה שאומנה על כל המאגרים עוקפת אותו, אבל הפער במשימות הסיווג קטן מאוד ומספיק ליישומים מעשיים רבים.

מתאים ל

  • חילוץ מאפיינים למולקולות

    יצירת וקטורים ממחרוזות SMILES למדידת דמיון כימי וחיפוש מהיר במאגרי תרכובות קטנות.

  • סיווג תכונות רפואיות

    אימון שכבות סיווג מעל המודל לחיזוי רעילות תרופות וחדירות למחסום הדם מוח.

  • הערכת מסיסות וליפופיליות

    כוונון עדין למשימות רגרסיה לחיזוי התנהגות פיזיקלית וכימית של תרכובות בשלבי פיתוח.

איפה זה נופל

הוא לא יודע לייצר מולקולות חדשות כלל, אלא רק לנתח מולקולות קיימות. חלון ההקשר מוגבל בקשיחות ל־202 טוקנים, מה שאומר שהוא עיוור לחלוטין למקרומולקולות, חלבונים או כל מבנה שמכיל מעל כ־200 אטומים. בנוסף, נתוני האימון נוקו ממידע איזומרי ועברו קנוניזציה, כך שהזנה של מחרוזות SMILES שאינן קנוניות או שאינן תקינות תפגע ישירות בדיוק התוצאות.

שאלות
נפוצות

האם המודל מתאים לפיתוח תרופות שמבוססות על חלבונים?

לא. המודל הוגבל באימון למולקולות קטנות של עד כ־200 אטומים וחלון הקשר של 202 טוקנים, ולכן הוא לא מסוגל לקרוא או לעבד מקרומולקולות.

למה לבחור בגרסת ה־10% ולא בגרסת ה־MoLFormer-XL המלאה?

גרסת ה־XL המלאה מציגה ביצועים עדיפים במרבית המדדים, במיוחד במשימות רגרסיה. הגרסה הזו מיועדת בעיקר למי שמחפש מודל קל שעדיין שומר על ביצועי סיווג קרובים מאוד למודל המלא.

איך מריצים

עם 47 מיליון פרמטרים ומשקל קבצים כולל של 179 מגה בייט, המודל הזה קל מאוד להרצה מקומית. אין צורך בכרטיסי מסך מפלצתיים, וכל מעבד גרפי פשוט או אפילו מעבד מרכזי רגיל יכול להריץ היסק במהירות ובזול דרך ספריית transformers הרגילה בתוך פייתון.

אין סיבה להסתמך על שירותי ענן חיצוניים או לשלם על קריאות API עבור מודל בגודל כזה. רק שימו לב שקריאה לטעינת המודל דורשת את הפרמטר trust_remote_code=True, ואם אתם עדיין עובדים עם גרסה 4 של transformers, צריך להגדיר את הגרסה תחת compat-v4 כדי להימנע משגיאות.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="ibm-research/MoLFormer-XL-both-10pct")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. הוא מתיר שימוש מסחרי חופשי, שינוי של הקוד והמשקלים, והפצה מחדש בתוך מוצרים סגורים או פתוחים. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים ומסמך הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗