GPT
C

ChemBERTa-zinc-base-v1

קוד פתוח

seyonecרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • jax
  • roberta
  • fill-mask

רוברטה קטן שאומן על מחרוזות כימיות במקום טקסט רגיל. אם אתם צריכים ייצוג וקטורי למולקולות או השלמת תווים במבנה כימי, הוא נותן נקודת זינוק קלה להרצה.

  • 514טוקנים בהקשר
  • 339 MBמשקל הקבצים
  • 117,716הורדות בחודש
  • 70לייקים

מה זה

מדובר במודל שפותח כדי לטפל במחרוזות כימיות מסוג SMILES במשימת השלמת תווים חסרים. הוא אומן על מאגר ZINC בהיקף של 100 אלף מולקולות על פני חמישה מחזורים בלבד. המבנה שלו מבוסס על שש שכבות, כך שהוא קומפקטי מאוד ביחס לטרנספורמרים רגילים.

בסיום האימון הוא הגיע לערך שגיאה של 0.398. המשמעות היא שהוא למד לזהות תבניות של אטומים וקבוצות פונקציונליות בסיסיות, אבל לפי המפתח שלו, השגיאה הייתה יכולה לרדת עוד לו היו מאמנים אותו ליותר מחזורים. הערך המרכזי כאן הוא היכולת להשתמש בו לייצוג מולקולות כקלט למודלים אחרים שבודקים רעילות, מסיסות או היתכנות סינתטית.

מתאים ל

  • הפקת וקטורים למולקולות

    חילוץ ייצוגים מתמטיים של קבוצות פונקציונליות עבור מודלים שבודקים מסיסות ורעילות.

  • השלמת מבנים כימיים

    ניבוי תווים חסרים בתוך מחרוזת SMILES לצורך בחינת וריאציות של מולקולה קיימת.

  • ויזואליזציה של קשרים

    ניתוח מנגנוני הקשב כדי לזהות אילו תתי מבנים במולקולה משפיעים על התנהגותה.

איפה זה נופל

האימון נעצר אחרי חמישה מחזורים בלבד ועל מאגר מוגבל של מאה אלף מחרוזות, מה שאומר שהוא עדיין לא ממצה את היכולת של הארכיטקטורה. מעבר לזה, המשימה שלו היא השלמת תווים בלבד, הוא לא חוזה רעילות או תכונות ישירות מהקופסה אלא דורש אימון המשך או חיבור למודל נוסף.

שאלות
נפוצות

האם המודל יודע לנבא בעצמו אם חומר מסוים הוא רעיל?

לא. המודל יודע רק לנבא תווים מוסתרים במחרוזת הכימית. כדי לבדוק רעילות צריך לקחת את הייצוגים שהוא מייצר ולהשתמש בהם כקלט למודל סיווג נוסף, או לאמן אותו באימון המשך על נתונים מתאימים.

האם כדאי להשתמש בו לפרויקט מסחרי של החברה?

עדיף להיזהר, כיוון שבעמוד המודל לא צוין שום רישיון שימוש. שימוש פנימי למחקר ובדיקות יעבור בלי בעיה, אבל שילוב שלו במוצר סופי שמוכרים ללקוחות עלול לחשוף אתכם לבעיות של זכויות יוצרים.

איך מריצים

המשקל הכולל של הקבצים עומד על 339 מגה בייט, כך שאין שום צורך בחומרה ייעודית כבדה או בחוות שרתים. אתם יכולים לטעון אותו ישירות דרך ספריית transformers של פייתון ולהריץ אותו מקומית על מעבד רגיל של מחשב נייד או בסביבת Colab חינמית בלי להרגיש מאמץ.

בגודל כזה ממש אין היגיון לשלם על קריאות שרת חיצוניות או לנהל נקודת קצה בענן, אלא אם אתם מריצים מיליוני מולקולות בשנייה. מורידים את הקבצים פעם אחת והכל רץ מקומית בלי תלויות.

from transformers import pipeline

pipe = pipeline("fill-mask", model="seyonec/ChemBERTa-zinc-base-v1")
print(pipe("שלום"))

הקבצים

9 קבצים במאגר, 339 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

היוצר לא הגדיר רישיון למודל. מבחינה משפטית, היעדר רישיון אומר שאין לכם הרשאה מפורשת להשתמש בו במוצר מסחרי או להפיץ אותו מחדש, וזה סיכון שצריך לקחת בחשבון אם בונים משהו שיוצא מחוץ למחקר פנימי.

הרישיון המלא בעמוד המודל ↗