GPT
B

BTL-4-Compact

קוד פתוח

badtheorylabsapache-2.02026-08-06

  • llama.cpp
  • gguf
  • agentic
  • tool-use
  • moe

גרסה מכווצת של מודל 35B שמצליחה לרוץ בקובץ יחיד של פחות מעשרה גיגה. היא מתאימה למי שרוצה להריץ סוכן מקומי עם הקשר ענק על חומרה ביתית.

  • 9.3 GBמשקל הקבצים
  • 127,608הורדות בחודש
  • 62לייקים

מה זה

מדובר בארכיטקטורת תערובת מומחים של 35.1 מיליארד פרמטרים, אבל רק כ־2.1 מיליארד מהם פעילים בכל טוקן. המשמעות היא שצורכים זיכרון של מודל גדול, אבל מקבלים מהירות חישוב של מודל קטן מאוד. הגרסה הזו נדחסה ל־2.30 ביט למשקל באמצעות כיול ממוקד לקוד ותיעוד טכני, במקום טקסט כללי מהרשת.

הבדיקות מראות שהכיווץ שומר על 94.1 אחוזים מההתנהגות של מודל המקור. בחילוץ מידע הוא שחזר מאה אחוז מהמקרים שנבדקו, ובעובדות קצרות הגיע ל־95 אחוזים. המבנה הפנימי כולל 30 שכבות של קשב ליניארי ורק 10 שכבות של קשב מלא, מה שמאפשר להחזיק חלון הקשר של 262 אלף טוקנים בעלות זיכרון של כ־5.2 גיגה בלבד למטמון.

מתאים ל

  • סוכן חילוץ מידע ממסמכים

    שומר על מאה אחוזי דיוק בחילוץ מידע טכני מבוסס, ומחזיק חלון הקשר עצום של 262 אלף טוקנים בעלות זיכרון נמוכה.

  • שכתוב ובדיקת קוד מקומי

    עבר כיול ייעודי על מאגרי קוד, מגיב מהר בזכות מעט פרמטרים פעילים, ורץ כולו על מחשב פיתוח יחיד.

  • סוכן כלים מרובה שלבים

    מבנה הכלים המובנה והפרדת החשיבה מאפשרים לו לתכנן ולבצע שרשרת קריאות בלי תלות ברשת חיצונית.

איפה זה נופל

הגרסה הזו מיועדת לטקסט בלבד, ורכיב הראייה הוסר ממנה לחלוטין. שכבת החיזוי הרב־טוקני מנוטרלת כאן בגלל שגיאה בהמרת הקבצים המקורית, כך שאי אפשר להשתמש בפענוח ספקולטיבי. מעבר לזה, במבחני דחיית הנחות שגויות הביצועים יורדים ל־87.2 אחוזים, מה שאומר שהמודל נוטה יותר לבלוע טעויות שמגיעות מהמשתמש במקום לתקן אותן.

שאלות
נפוצות

האם המודל תומך בעיבוד תמונות כמו מודל המקור?

לא. רכיב הראייה הוסר מהבנייה הזו כדי לשמור על גודל קובץ מינימלי, והיא מקבלת ומייצרת טקסט בלבד.

למה הסוכן חוזר על אותה פעולה בלולאה?

זה קורה כשמריצים את השרת בלי הדגל reasoning-format deepseek או עם תבנית שיחה חיצונית. בלי ההגדרות האלה המודל צובר את מחשבות העבר שלו בתוך גוף השיחה עד שהוא ממצה את התקציב.

האם אפשר להשתמש במטמון של 4 ביט כדי לחסוך עוד זיכרון?

עדיף שלא. המשקלים כבר מכווצים מאוד, ודחיסה אגרסיבית של המטמון פוגעת ביכולת שלו לעקוב אחרי מצב הפעולות לאורך זמן וגורמת לו לבצע מחדש עבודה שכבר הסתיימה.

איך מריצים

המודל רץ דרך llama.cpp, Ollama או LM Studio, ודורש תמיכה בארכיטקטורת qwen3_5_moe. כדי שהקובץ יעלה, צריך כרטיס מסך או זיכרון אחוד שיכולים להחזיק כעשרה גיגה עבור המשקלים, ועוד כמה גיגות למטמון אם פותחים חלון הקשר רחב. חייבים להפעיל את הדגל jinja כדי שהתבנית המובנית תעבוד, כי המודל מייצר קריאות לכלים בפורמט ייחודי ולא בפורמט הרגיל של קוון.

בנוסף, חובה להגדיר את פורמט החשיבה ל־deepseek. בלי ההגדרה הזו, תהליך ההסקה נשמר בתוך תוכן התשובה ומצטבר בכל תור שיחה, מה שגורם למודל להיכנס ללולאה אינסופית ולחזור על אותן פעולות עד שנגמר התקציב. מומלץ גם לשמור על מטמון בפורמט q8_0 כדי למנוע איבוד מעקב במשימות ארוכות.

ollama run hf.co/badtheorylabs/BTL-4-Compact:IQ2_XXS

הקבצים

5 קבצים במאגר, 9.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache-2.0, שמאפשר שימוש חופשי כולל שימוש מסחרי מלא, שינוי הקוד והפצה של המודל בתוך מוצרים סגורים. התנאי העיקרי הוא שמירה על הודעות זכויות היוצרים והצהרת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗