GPT
B

bitnet-b1.58-2B-4T-gguf

קוד פתוח

microsoftmit2025-04-15

  • transformers
  • gguf
  • chat
  • bitnet
  • text-generation

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל שפה שמכווץ משקלים לערכים של מינוס אחת, אפס ואחת ישירות באימון. המטרה היא להריץ מודל של שני מיליארד פרמטרים על מעבד רגיל בצריכת זיכרון וחשמל נמוכות במיוחד.

  • 1.1 GBמשקל הקבצים
  • 7,795הורדות בחודש
  • 295לייקים

מה זה

מיקרוסופט אימנה כאן מודל של שני מיליארד פרמטרים מאפס על ארבעה טריליון טוקנים, תוך שימוש בשיטת כימוס טבעית של 1.58 ביט למשקלים ו־8 ביט לאקטיבציות. לא מדובר בכיווץ של מודל קיים לאחר מעשה. הארכיטקטורה משתמשת בשכבות BitLinear ייעודיות ללא הטיה, יחד עם טוקנייזר של LLaMA 3.

בבדיקות הביצועים מול מודלים רגילים בגדלים של 1 עד 2 מיליארד פרמטרים, הוא מציג זיכרון עבודה ללא אמבדינגס של 0.4 גיגה־בייט לעומת 1.4 עד 4.8 גיגה־בייט אצל המתחרים. זמן הפענוח למעבד עומד על 29 מילישניות, והערכת האנרגיה יורדת ל־0.028 ג'אול. במבחני ידע וחשיבה הוא מגיע לממוצע של 54.19, קרוב מאוד ל־Qwen2.5 1.5B שמוביל עם 55.23, ועוקף מודלים כמו SmolLM2 ו־LLaMA 3.2 1B.

מתאים ל

  • עוזר מקומי למכשירי קצה

    צריכת הזיכרון הנמוכה של 0.4 גיגה־בייט מאפשרת להריץ שיחה בסיסית על מעבדים חלשים בלי לפגוע במשאבי המערכת.

  • פתרון בעיות מתמטיקה קלות

    המודל השיג ציון של 58.38 במבחן GSM8K, תוצאה גבוהה ביחס לגודל של שני מיליארד פרמטרים.

  • מענה קולי או בוט מבוסס CPU

    זמן פענוח של 29 מילישניות למעבד מאפשר תגובה מהירה באנגלית בלי להחזיק שרת יקר עם מאיץ גרפי.

איפה זה נופל

האימון נעשה באנגלית בלבד, וחלון ההקשר מוגבל ל־4,096 טוקנים, כך שהוא לא יתאים למסמכים ארוכים ללא התאמה נוספת. במבחני קוד וכתיבה מורכבת הוא נופל ממתחרים, עם 38.40 בלבד ב־HumanEval פלוס לעומת 50.60 ב־Qwen2.5, וציון 53.48 ב־IFEval. בנוסף, מיקרוסופט מציינת במפורש שהמודל מיועד לצורכי מחקר ופיתוח ועלול לפלוט מידע שגוי או מוטה.

אותה משפחה

bitnet-b1.58-2B-4T יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר פשוט להריץ אותו דרך ספריית transformers בפייתון?

אפשר טכנית, אבל אין בכך היגיון. הקרנלים שמייצרים את החיסכון במהירות ובחשמל קיימים כרגע רק בספריית bitnet.cpp, והרצה בפייתון תעבוד לאט כמו מודל רגיל.

האם המודל תומך בעברית?

הכרטיס מצהיר על תמיכה בשפה האנגלית בלבד, והוא אומן על טקסטים וקוד ציבוריים באנגלית לצד נתונים סינתטיים. לא כדאי להסתמך עליו למשימות בעברית.

איך מריצים

הקבצים בפורמט GGUF שוקלים יחד 1.1 גיגה־בייט, כך שכל מחשב משרדי או מעבד בסיסי יכול לטעון אותם ללא כרטיס מסך ייעודי. כדי לקבל את מהירות הפענוח והחיסכון באנרגיה שמופיעים במבחנים, חייבים להריץ אותו דרך ספריית bitnet.cpp ב־C++. אם תטענו אותו דרך ספריית transformers הרגילה בפייתון, לא תרוויחו את השיפור בביצועים ובמהירות בגלל היעדר קרנלים מתאימים.

גרסת ה־GGUF הזו מיועדת להרצה על מעבדים. מי שרוצה לאמן או לבצע כוונון עדין יצטרך לפנות לגרסת ה־bf16, ומי שמחפש פריסה ישירה עם משקלים ארוזים ישתמש בגרסה הרגילה. אם אתם צריכים רק להוציא טקסט גנרי בענן ולא מוגבלים במשאבי חומרה מקומיים, שירות API מנוהל של מודל גדול יחסוך את כאב הראש של קימפול הספריות.

ollama run hf.co/microsoft/bitnet-b1.58-2B-4T-gguf:ggml-model-i2_s

הקבצים

4 קבצים במאגר, 1.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל והקוד משוחררים תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗