GPT
E

evo-1-131k-base

קוד פתוח

togethercomputerapache-2.02024-02-20

  • transformers
  • safetensors
  • stripedhyena
  • text-generation
  • long context

מודל ביולוגי שמנתח ומייצר רצפי דנא ברזולוציה של נוקלאוטיד בודד ובהקשר ענק. הוא מיועד למי שצריך לעבוד על גנומים שלמים ולא על שברי מקטעים.

  • 6.5Bפרמטרים
  • 27.7 GBמשקל הקבצים
  • 1,766הורדות בחודש
  • 117לייקים

מה זה

זהו מודל שפה ביולוגי שמבוסס על ארכיטקטורת StripedHyena ולא על טרנספורמר רגיל. הוא אומן על OpenGenome, מאגר של כ־300 מיליארד טוקנים מגנומים של פרוקריוטים, כדי לקרוא רצפים גנטיים ארוכים במיוחד. במקום להיתקע בסיבוכיות ריבועית, הארכיטקטורה משלבת מנגנוני קשב יחד עם קונבולוציות מגודרות ומאפשרת יעילות חישובית שמתקרבת לליניארית ביחס לאורך הרצף.

ההבדל המשמעותי לעומת מודלים סטנדרטיים של שבעה מיליארד פרמטרים מתבטא בביצועים ברצפים ארוכים. המודל מסוגל לעבד חלון הקשר של 131,072 נוקלאוטידים, ובבדיקות הוא ייצר בהצלחה רצפים של מעל 650 אלף בסיסים. החוקרים מדווחים על אימון מהיר פי שלושה באורך הקשר כזה לעומת ארכיטקטורות קודמות, לצד עמידות באימון עם כמות נתונים שחורגת בהרבה מההמלצות המקובלות.

מתאים ל

  • תכנון רצפי דנא ארוכים

    יצירה אוטומטית של מקטעים גנומיים מעל חצי מיליון בסיסים בזכות ארכיטקטורת Hyena.

  • הבנת גנומים פרוקריוטיים

    מידול וניתוח גנומי שלם של חיידקים ברמת נוקלאוטיד יחיד ובהקשר של 131 אלף בסיסים.

  • בסיס לאימון מודלים גנטיים

    נקודת מוצא לכוונון עדין על משימות הנדסה גנטית שדורשות הבנת רצף ארוך במיוחד.

איפה זה נופל

המודל מוגבל ביולוגית וטכנית. הוא אומן על יצורים פרוקריוטיים בלבד, ולכן הוא לא מתאים לעבודה ישירה על גנום האדם או אורגניזמים מורכבים אחרים בלי התאמות משמעותיות. בנוסף, מדובר במודל בסיס גולמי שלא עבר כוונון למשימות יישומיות ספציפיות כמו תכנון מערכות עריכה גנטית, בניגוד לגרסאות הייעודיות שמבוססות על מודל ה־8k.

בצד התוכנה, התלות בקרנלים ייחודיים ובשילוב שאינו טרנספורמר רגיל הופכת את התחזוקה והפריסה שלו למסורבלת. אי אפשר פשוט לטעון אותו בכל ספרייה סטנדרטית בלי התקנות מורכבות.

שאלות
נפוצות

האם המודל מיועד לטקסט רגיל בשפות אנושיות?

לא. למרות שהוא מוגדר כמשימת text-generation, הוא אומן על נתונים ביולוגיים של דנא ולא יפיק שום תוצאה הגיונית בשיחה, תרגום או קוד מחשב.

למה חשוב להשתמש בגרסת 1.1_fix?

המפתחים גילו שגיאה בסדר ההיטלים של השכבות בגרסה המקורית שפגעה ישירות באיכות הפלט, והוציאו תיקון ייעודי שמחייב הגדרה מפורשת בקוד.

איך מריצים

כדי להריץ אותו צריך כרטיס גרפי רציני. המודל שוקל כ־27.7 גיגהבייט בדיוק bfloat16, ובזכות מצב ריצה רקורסיבי אפשר לייצר רצפים של מעל חצי מיליון בסיסים על גבי כרטיס בודד של 80 גיגהבייט זיכרון. אם אין לכם חומרה כזו מקומית, עדיף להשתמש בתשתית ענן ייעודית.

ההטמעה שלו דורשת שימת לב מיוחדת. חייבים להתקין קרנלים מותאמים אישית מתוך המאגר של StripedHyena, לאפשר קוד מרוחק, ולטעון את הרוויזיה הספציפית 1.1_fix שמתקנת שגיאה בהיטלי השכבות. בנוסף, חשוב לוודא שמשתני ה־poles וה־residues נשארים בדיוק float32 בזמן הסקת מסקנות כדי לשמור על היציבות החישובית.

from transformers import pipeline

pipe = pipeline("text-generation", model="togethercomputer/evo-1-131k-base")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון apache-2.0, שמאפשר שימוש חופשי כולל שימוש מסחרי, שינוי של הקוד והפצה מחדש. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי אחריות משפטית מצד המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗