GPT
B

BTL-4

קוד פתוח

badtheorylabsapache-2.02026-08-05

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • agentic

מודל מבוסס תערובת מומחים שמיועד לסוכני תכנה, קריאות לכלים וריצות ארוכות. הוא הותאם על בסיס קוד שנבדק בריצה כדי לייצר שרשראות חשיבה שמגיעות לפתרון עובד.

  • 35Bפרמטרים
  • 262,144טוקנים בהקשר
  • 65.4 GBמשקל הקבצים
  • 6,483הורדות בחודש

מה זה

מדובר במודל של 35 מיליארד פרמטרים בארכיטקטורת תערובת מומחים של Qwen3.5, שעבר כוונון עדין על גבי Ornith-1.0-35B. הרעיון המרכזי באימון היה שמירה של מסלולי חשיבה אך ורק אם הקוד שנכתב בסופם עבר בהצלחה בדיקות והרצה בפועל. זה מוציא ממנו פתרונות פרקטיים יותר לסביבות עבודה מורכבות של פיתוח תוכנה.

במבחנים הוא מציג יכולות גבוהות במיוחד למשימות סוכנים. ב־SWE-bench Verified הוא מגיע ל־78.4 אחוזים, ובבדיקת קריאה לפונקציות BFCL v4 הוא עומד על 73.5 אחוזים. ב־LiveCodeBench v6 הוא פותר 99.1 אחוזים מהבעיות הקלות ו־86.7 אחוזים מהבינוניות, אבל צונח ל־60.5 אחוזים בבעיות קשות שמורידות את הציון הכולל שלו ל־66.1 אחוזים.

מתאים ל

  • סוכני פיתוח תוכנה עצמאיים

    מתאים לפתרון באגים במאגרי קוד הודות לציון של 78.4 אחוזים במבחן SWE-bench ויכולת עבודה בחלון הקשר עצום.

  • מערכות הפעלת כלים ו־API

    מבצע קריאות פונקציה מדויקות לפי תחביר מוגדר עם תוצאה של 73.5 אחוזים בבדיקות BFCL.

  • פתרון בעיות אלגוריתמיות

    פותר כמעט ללא שגיאות בעיות תכנות ברמה קלה ובינונית, בתנאי שמשאירים לו תקציב טוקנים נדיב לתהליך המחשבה.

איפה זה נופל

זה לחלוטין לא מודל לצ'אט רגיל. הוא מייצר פלט ארוך ומנתח תהליכים לפני התשובה, מה שהופך אותו לזללן טוקנים כבד. בבעיות קשות העלאת מכסת הטוקנים מ־16 אלף ל־32 אלף שיפרה משמעותית את התוצאות, כי ב־16 אלף כמעט רבע מהבעיות פשוט נחתכו באמצע ונכשלו.

הבעיה הטכנית הקריטית ביותר היא הצטברות החשיבה בסבבים מרובים של סוכן. אם שרת ההרצה לא מוגדר להפריד את תוכן החשיבה מהתשובה הרגילה, הטקסט של החשיבה נשפך לתשובה, נערם בכל סבב, והמודל נכנס ללופים וחוזר על עצמו במקום לסיים משימות.

שאלות
נפוצות

האם המודל מתאים לשיחה שוטפת מול משתמשים באפליקציה?

לא, הוא נבנה כמודל חשיבה לסוכנים ולמשימות תוכנה. הוא נוטה לאריכות דברים, מייצר תהליכי חשיבה מפורטים לפני כל מענה, ומבזבז משאבים רבים על שיחות פשוטות שלא דורשות פתרון בעיות לוגי עמוק.

למה המודל נתקע וחוזר על עצמו בריצות ארוכות של סוכן?

התקלה מתרחשת כשסביבת ההרצה אינה מפרידה את טקסט החשיבה מהתוכן הראשי. ב־vLLM יש להפעיל את הדגל ייעודי של qwen3 וב־llama.cpp להגדיר פורמט חשיבה deepseek, אחרת החשיבה מצטברת בסבבים ופוגעת בריצה.

כמה טוקנים צריך להקצות לו לפלט בכל הרצה?

במשימות קוד מורכבות מומלץ להקצות תקציב של עד 32 אלף טוקנים לפלט. המפתחים הראו שבמכסה של 16 אלף טוקנים כמעט 23.5 אחוזים מהבעיות נקטעו באמצע הפתרון וקיבלו ציון אפס.

איך מריצים

המשקל המלא שוקל 65.4 ג'יגה בייט בפורמט bfloat16, כך שתצטרכו לפחות 80 ג'יגה בייט זיכרון גרפי כמו כרטיס A100 או H100 יחיד רק כדי לטעון אותו, ועוד זיכרון נרחב אם תרצו לנצל את חלון ההקשר המלא שמגיע ל־262,144 טוקנים. אפשר להריץ אותו דרך vLLM עם מפענחי הכלים והחשיבה הייעודיים, או בגרסת GGUF מכווצת כמו IQ2_XXS דרך llama-server למחשבים עם משאבים מוגבלים יותר.

אם אתם לא מחזיקים תשתית שרתים מקומית מתאימה או זקוקים להרצות בודדות בלבד, החזקה של חומרה ייעודית כזו תהיה יקרה ולא משתלמת בהשוואה לשימוש בפתרונות ענן לפי צריכה.

from transformers import pipeline

pipe = pipeline("text-generation", model="badtheorylabs/BTL-4")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון קוד פתוח מסחרי מסוג Apache 2.0. הרישיון מאפשר שימוש חופשי לחלוטין לצרכים פרטיים ומסחריים, כולל שינוי המשקלים, הפצה ושילוב במוצרים מסחריים סגורים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗