GPT
C

Carbon-8B

קוד פתוח

HuggingFaceBioapache-2.02026-05-17

  • transformers
  • safetensors
  • llama
  • text-generation
  • dna

מודל שפה אוטורגרסיבי ייעודי לרצפי דנא ורנא עם שמונה מיליארד פרמטרים. הוא מיועד לחיזוי השפעת מוטציות ושליפה מהקשר גנומי ארוך של עד מאות אלפי בסיסים.

  • 8.3Bפרמטרים
  • 32,768טוקנים בהקשר
  • 15.4 GBמשקל הקבצים
  • 1,987הורדות בחודש

מה זה

הוא מבוסס על ארכיטקטורת Llama רגילה, אבל אומן על מיליארד טוקנים של 6-mer, שהם שווי ערך לשישה טריליון בסיסי דנא, בעיקר של איקריוטים. הטוקנייזר שלו היברידי, הוא משלב קידוד קבוע של שישה בסיסים לטוקן עם טוקנייזר טקסט של Qwen3 לאנגלית. התוצאה היא יכולת לחזות וליצור רצפים ביולוגיים כשרצף הדנא תחום בתגיות מתאימות, במקום להתייחס לטקסט כללי.

בבדיקות השוואתיות מול הגרסה הקטנה יותר של שלושה מיליארד פרמטרים, הוא מציג שיפור עקבי כמעט בכל מדד. בשחזור רצפים איקריוטיים הוא מגיע ל־64.05 אחוזים לעומת 61.54, ובמשימת שינוי שלישיות נוקלאוטידים הוא עולה מ־85.20 ל־89.05 אחוזים. השיפור הבולט ביותר מופיע בשליפה מהקשר ארוך במבחן Genomic-NIAH, שבו הוא קופץ מ־79 ל־86 אחוזים בעומק של 393 אלף בסיסים.

מתאים ל

  • חיזוי השפעת מוטציות

    הוא מקבל רצף גנומי ומזהה האם שינוי בסיס בודד פוגע בתפקוד, בזכות דיוק גבוה ב־ClinVar שעובר 93 אחוזים.

  • ניתוח מוטיבים בהקשר ארוך

    היכולת להחזיק כ־196 אלף בסיסים באופן טבעי מתאימה לניתוח אזורים גנומיים נרחבים סביב גנים שלמים.

  • ניקוד הסתברותי לרצפי דנא

    ענף fns מאפשר לחשב את סבירות הרצף בכל בסיס בנפרד, מה שמאפשר להשוות בין רצף מקורי לרצף שעבר שינוי.

איפה זה נופל

למרות ההקשר המוצהר, הביצועים הטבעיים שלו בהקשרים קצרים של 16 אלף ו־32 אלף טוקנים נמוכים משמעותית מאלה של מודלים מתחרים כמו Evo2 7B שמשיג מעל 0.95 לעומת 0.69 בלבד אצלו. מעבר לזה, אם לא מפעילים הרחבת YaRN פי 4, הדיוק בשליפה צונח דרסטית ככל שמתקרבים לקצה החלון. המודל מתמקד באיקריוטים וכולל רק 10 אחוזים של מידע מפרוקריוטים, כך שהוא פחות מתאים לחקר חיידקים.

אותה משפחה

Carbon יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך מזינים אליו רצף דנא בצורה נכונה?

עוטפים את הרצף בתגית ייעודית של dna ומקפידים שאורך הרצף יהיה כפולה של 6 בסיסים. הטוקנייזר חותך כל שישייה לטוקן יחיד, כך שרצף שלא מתחלק בשש ייצור בעיות בעיבוד.

האם הוא מבין פרומפטים רגילים באנגלית?

הוא כולל את הטוקנייזר של Qwen3 לאנגלית, אבל אומן בעיקר על רצפים ביולוגיים. לא מדובר בעוזר שיחה כללי, והוא נועד לייצור, השלמה וניתוח של רצפי חומצות גרעין.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך עם לפחות 24 גיגה זיכרון כדי לטעון את 15.4 הגיגה של המשקלים ב־bfloat16 יחד עם זיכרון העבודה של ההקשר. טוענים אותו ישירות דרך ספריית transformers הרגילה, אבל מי שרוצה שליטה או ניקוד ברמת הבסיס הבודד ולא בקפיצות של שישה בסיסים צריך למשוך את ענף fns עם trust_remote_code.

אם אתם צריכים רק שאילתות קצרות ומהירות של חיזוי, גרסת ה־3B תעשה עבודה דומה בחצי מהמשאבים. לשרת בעצמכם שווה בעיקר כשעובדים עם מידע גנטי רגיש שאסור להוציא לענן חיצוני, או כשרוצים להריץ הרחבת YaRN פי 4 שמגיעה עד 786 אלף בסיסים.

from transformers import pipeline

pipe = pipeline("text-generation", model="HuggingFaceBio/Carbon-8B")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון apache-2.0 חופשי. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לאמן עליו מודלים פנימיים ולשלב אותו בתוך מוצר סגור, בלי לשלם תמלוגים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקוד או בהפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗