GPT
C

Carbon-3B

קוד פתוח

HuggingFaceBioapache-2.02026-05-12

  • transformers
  • safetensors
  • llama
  • text-generation
  • dna

זה מודל שפה ייעודי לרצפי דנ״א שמכווץ גנום שלם לטוקנים יעילים ומריץ חיזויים ביולוגיים במהירות חריגה ביחס לגודלו. הוא נותן חלופה מקומית וקלה למודלי ענק כבדים.

  • 3.5Bפרמטרים
  • 32,768טוקנים בהקשר
  • 6.4 GBמשקל הקבצים
  • 1,645הורדות בחודש

מה זה

המודל פועל כמודל גנרטיבי לרצפי דנ״א ורנ״א, עם התמקדות משמעותית ביצורים אאוקריוטיים. בניגוד למודלים שמפרקים רצפים לבסיס בודד בכל פעם, הוא משתמש בטוקנייזר שמקבץ שישיות של בסיסים יחד. הגישה הזו מאפשרת לו לדחוס חלון הקשר טבעי של כמעט מאתיים אלף זוגות בסיסים, ולהגיע לכמעט ארבע מאות אלף באמצעות מתיחה.

במבחני חיזוי השפעת מוטציות ודיוק שחזור רצפים, המודל עומד מול מתחרים גדולים ממנו בהרבה, כמו מודל של שבעה מיליארד פרמטרים. במדדי וריאנטים קליניים הוא מוביל במקרים לא מקודדים ומציג ביצועים כמעט זהים באזורים מקודדים, כשהיתרון המעשי הוא מהירות ריצה גבוהה במיוחד שמאפשרת סריקת גנומים שלמים בלי צווארי בקבוק.

מתאים ל

  • חיזוי השפעת מוטציות

    חישוב הסתברויות לרצפים מאפשר לזהות האם שינוי בבסיס בודד או באזור לא מקודד עלול לפגוע בתפקוד הביולוגי.

  • ניתוח רצפים ארוכים

    חלון ההקשר הנרחב מתאים לאיתור מוטיבים גנטיים מרוחקים זה מזה על פני מאות אלפי בסיסים בו זמנית.

  • יצירה מותנית של מקטעי דנ״א

    שימוש בתגיות מטא דאטה מאפשר לכוון את הפקת הרצפים לפי מין ביולוגי או סוג הגן הנדרש.

איפה זה נופל

הטוקנייזר מקבל אך ורק את ארבע האותיות הבסיסיות של דנ״א באותיות גדולות. אם הרצף שלכם כולל אותיות קטנות או קודי אי־ודאות ביולוגיים נפוצים, המודל פשוט יהפוך אותם לערכים לא מוכרים ואיכות הפלט תיהרס. בנוסף, חובה לעטוף כל קלט בתגית ייעודית, אחרת המערכת מפרשת את הרצף כטקסט באנגלית ומאבדת את כל הדיוק. מעבר לכך, האימון התמקד בעיקר ביצורים אאוקריוטיים, כך שחיידקים ויצורים פרוקריוטיים מקבלים ייצוג מוגבל יחסית, והרחבת ההקשר מעבר לשישים וארבעה אלף טוקנים מובילה לנפילה חדה ביכולת לשלוף נתונים מהרצף.

אותה משפחה

Carbon יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין טקסט חופשי באנגלית לצד רצפי דנ״א?

הטוקנייזר כולל מילון אנגלי, אבל המודל עצמו לא אומן להבין הנחיות מילוליות מורכבות או לנהל שיחה. הזנת טקסט רגיל שלא עטוף בתגיות הייעודיות תפגע בביצועים.

איך מטפלים ברצף שאורכו לא מתחלק בשש?

הטוקנייזר מקבץ שישיות, ואם הרצף לא מתחלק בשש הוא מרפד את הסוף באותיות שלא שייכות לקלט המקורי. כדי למנוע שיבושים בתוצאה, חתכו מראש את השארית לפני ההזנה למודל.

איך מריצים

המשקל הכולל עומד על 6.4 גיגה בייט בפורמט bfloat16, מה שאומר שכרטיס מסך בודד עם 16 גיגה זיכרון יספיק לטעינה והרצה פשוטה. אם אתם רוצים למתוח את חלון ההקשר עד לקצה של שישים וארבעה אלף טוקנים, תצטרכו כרטיס עם 24 גיגה זיכרון ומעלה כדי להתמודד עם צריכת הזיכרון של שכבות תשומת הלב. המודל בנוי על ארכיטקטורת Llama ונתמך ישירות בספריות כמו vLLM, כך שקל לשלב אותו בסביבות שרת קיימות.

לצד המודל הזה קיים גם מודל קטן של חצי מיליארד פרמטרים, שמיועד לשמש כטיוטה להאצת ההפקה של המודל הראשי. למי שעובד על רצפים קצרים או מריץ ניסוי חד פעמי, עדיף להשתמש בנקודת קצה מנוהלת ולא להקים תשתית עצמאית.

from transformers import pipeline

pipe = pipeline("text-generation", model="HuggingFaceBio/Carbon-3B")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והמשקולות, שילוב במוצרים פנימיים והפצה ללקוחות. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים שמפיצים הלאה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗