GPT
M

Mol-Instructions

קוד פתוח

zjunlpcc-by-4.02023-06-10

  • chemistry
  • biology
  • molecule
  • protein
  • instructions

המאגר מרכז הוראות באנגלית לכוונון מודלי שפה עבור משימות כימיות וביולוגיות. הוא מיועד למי שרוצה לאמן מודל להבין מולקולות קטנות, לתכנן רצפי חלבונים ולחלץ ישויות ביוכימיות מטקסט רפואי.

  • 1,887הורדות בחודש
  • 70לייקים

מה זה

הנתונים מחולקים לשלושה קבצי ארכיון נפרדים שמכילים משימות מובנות. החלק הראשון מתמקד במולקולות קטנות וכולל 148.4 אלף הוראות בשישה תחומים, ביניהם חיזוי ריאקציות כימיות, רטרוסינתזה, חיזוי תכונות ותיאור מולקולרי. החלק השני מוקדש לחלבונים עם 505 אלף רשומות בחמש קטגוריות, ועוסק בתכנון חלבונים לפי דרישות טקסטואליות, חיזוי פעילות קטליטית, זיהוי מוטיבים ופעילות תאית. החלק השלישי פונה לעיבוד שפה טבעית ביוכימי עם 53 אלף הוראות של שאלות ותשובות וחילוץ קשרים בין חומרים למחלות.

תהליך הבנייה התבסס על מאגרי מידע ביוכימיים קיימים שעברו המרה לטקסט בעזרת תבניות ידניות מוגדרות מראש. תיאורי המשימות עצמם פותחו בשילוב אנושי יחד עם GPT-3.5-turbo ליצירת ניסוחים מגוונים. לפי כותבי המאגר, הנתונים עברו סינון בקרת איכות לפני פרסומם כדי לווסת את דיוק המבנים המולקולריים שנוצרו.

מתאים ל

  • תכנון חלבונים מלאכותיים

    אימון מודל שפה לייצר רצפי חומצות אמינו שתואמים תנאים ביולוגיים מוגדרים מראש.

  • חיזוי ריאקציות כימיות

    זיהוי תוצרים אפשריים או חומרי מוצא בסינתזה על בסיס ייצוג מולקולרי מובנה.

  • חילוץ קשרים ביוכימיים

    שליפת אינטראקציות בין תרופות למחלות מתוך מאמרים מדעיים ודוחות קליניים.

איפה זה נופל

היוצרים מבהירים במפורש שהנתונים והמודלים שחולצו מהם מהווים הדגמה ראשונית בלבד, ולא מתאימים לשימוש במערכות פרודקשן אמיתיות. כל המידע הטקסטואלי מוגש באנגלית בלבד וכולל סימונים מולקולריים מורכבים כמו רצפי חומצות אמינו, לכן הוא לא מתאים לעיבוד שפה בעברית. שימוש במודל שמאומן על נתונים אלה בתעשיית התרופות דורש בדיקת מעבדה קפדנית, כי המאגר מבוסס חלקית על ניסוחי תבניות וסינתוז טקסט ולא מחליף ניסוי אמפירי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון המוצהר בכרטיס הוא cc-by-4.0, אך מפרסמי הדאטהסט כתבו במפורש בהערות שהוא מיועד אך ורק למחקר ואסור לכל שימוש מסחרי. הסתירה הזו הופכת שימוש מסחרי למסוכן משפטית. עבור חברות שמפתחות מוצר רווחי, מומלץ להימנע משימוש בו.

האם המאגר כולל טקסטים או תמיכה בעברית?

המאגר כולו כתוב באנגלית ומשלב ייצוגים כימיים ורצפי חלבונים באותיות לטיניות. אין בו נתונים בעברית כלל. מודל שיאומן עליו בלבד לא ידע לנתח ספרות ביוכימית או לתקשר בעברית.

מאיפה הגיעו הנתונים ואיך בנו אותם?

המידע הביולוגי והכימי נלקח ממאגרי נתונים ביוכימיים מוכרים ועבר המרה למבנה טקסטואלי באמצעות תבניות קבועות. בנוסף, החוקרים השתמשו במודל GPT-3.5-turbo כדי לייצר ניסוחים מגוונים להנחיות ולמשימות מתוך תיאורים אנושיים בסיסיים. בסיום התהליך בוצעה בקרת איכות על המבנים שנוצרו.

מה הגודל והפורמט של הקבצים להורדה?

הנתונים מחולקים לשלושה קובצי ZIP לפי התחומים השונים, לצד סקריפט טעינה בפייתון. סך הרשומות מגיע למאות אלפי הוראות המחולקות בין תחומי המולקולות, החלבונים והטקסט הביוכימי. ההורדה מתבצעת ישירות מהעמוד ללא צורך בהרשאות גישה מיוחדות.

איך טוענים

המאגר מוגש כקבצי ZIP דחוסים לפי חלוקה נושאית לצד סקריפט פייתון Mol-Instructions.py לטעינה ישירה. אין צורך בבקשת גישה מיוחדת או באישור ידני מהיוצרים, מורידים את הקבצים ישירות מהעמוד. כדי לעבוד איתם צריך לחלץ את הארכיונים ולקרוא את מבני הטקסט שמכילים את ההוראה, הקלט הביוכימי והפלט הצפוי.

from datasets import load_dataset

ds = load_dataset("zjunlp/Mol-Instructions")

הרישיון

המאגר מוגדר רשמית תחת רישיון cc-by-4.0, אך בטקסט הנלווה היוצרים הגבילו את השימוש למטרות מחקר בלבד ואסרו שימוש מסחרי. ההתנגשות הזו יוצרת סיכון משפטי ברור לחברות ולסטארטאפים. אם אתם מתכננים לאמן מודל למוצר מסחרי, אל תיגעו במאגר הזה בלי ייעוץ משפטי, שכן תנאי השימוש שהוצבו בפועל אינם מאפשרים הפצה מסחרית.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗