GPT
B

bitnet-b1.58-2B-4T

קוד פתוח

microsoftmit2025-04-15

  • transformers
  • safetensors
  • bitnet
  • text-generation
  • chat

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל שפה ראשון בסדר גודל כזה שאומן מראש עם משקולות של 1.58 ביט בלבד. הוא מאפשר ריצה מקומית מהירה וחסכונית מאוד בחשמל ובזיכרון על מעבדים רגילים.

  • 850Mפרמטרים
  • 4,096טוקנים בהקשר
  • 1.1 GBמשקל הקבצים
  • 22,147הורדות בחודש

מה זה

מיקרוסופט אימנה כאן מודל מאפס עם ערכים טרנאריים של 1-, 0 ו־1+, במקום לקחת מודל קיים ולכווץ אותו אחרי האימון. הוא עבר אימון על ארבעה טריליון טוקנים, כולל קוד וטקסט סינתטי במתמטיקה, יחד עם שלבי יישור בהוראות והעדפות אנושיות. המשקל הכולל של הקבצים עומד על 1.1 גיגה בייט בלבד.

במבחני ביצועים מול מודלים רגילים במשקל דומה, הוא עומד יפה בתחרות. בבדיקות חשיבה כמו ARC ופתרון בעיות חשבון ב־GSM8K עם ציון 58.38 הוא אפילו עוקף מתחרים כמו Qwen2.5 1.5B ו־SmolLM2. ההבדל הגדול באמת הוא לא רק הדיוק, אלא צריכת המשאבים. במבחני ריצה על מעבד, הוא דרש 0.4 גיגה בייט זיכרון לעומת גיגה וחצי עד כמעט חמישה גיגה במודלים מקבילים, עם שבריר מצריכת האנרגיה וזמן תגובה של 29 מילישניות.

מתאים ל

  • עוזר חכם במכשירי קצה

    הוא צורך 0.028 ג'אול ופחות מחצי גיגה זיכרון, מה שמתאים לחומרה חלשה בלי כרטיס מסך ייעודי.

  • פתרון בעיות מתמטיקה

    התוצאות שלו ב־GSM8K ובמבחני היגיון עוקפות את רוב המודלים בגודל שלו, כל עוד השאלה באנגלית.

  • מערכות עם סוללה מוגבלת

    צריכת האנרגיה הנמוכה ב־bitnet.cpp מאפשרת להריץ לוגיקה מקומית על רחפנים או מכשירי IoT.

איפה זה נופל

התמיכה בעברית ובכל שפה שאינה אנגלית מוגבלת מאוד לפי התיעוד הרשמי, כך שאי אפשר לבנות עליו לטקסט מקומי בלי אימון נוסף. חלון ההקשר שלו נעצר ב־4,096 טוקנים, מה שפוסל אותו מניתוח מסמכים ארוכים. היוצרים מציינים שיעור שגיאות גבוה ספציפית בשאלות סביב בחירות, וממליצים במפורש לא להכניס אותו למוצרים מסחריים בלי בדיקות מעמיקות כי מדובר בעיקר בכלי מחקר.

אותה משפחה

bitnet-b1.58-2B-4T יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר פשוט להתקין אותו בפייתון ולהריץ?

אפשר לטעון אותו עם transformers אבל זה לא ייתן שום יתרון בביצועים. כדי לנצל את המהירות וחיסכון האנרגיה צריך להשתמש ב־bitnet.cpp.

המודל מבין עברית?

הכרטיס מציין תמיכה מוגבלת מאוד בשפות שאינן אנגלית. לא הייתי בונה עליו לשום עיבוד טקסט בעברית בלי אימון המשך.

איך מריצים

טעינה רגילה דרך ספריית transformers תעבוד, אבל תפספס את כל הפואנטה. המפתחים מבהירים שאין בה קרנלים מותאמים לארכיטקטורה הזו, ולכן המהירות וצריכת החשמל שם יהיו דומות או גרועות יותר ממודל רגיל, גם על מעבד וגם על כרטיס מסך. כדי לקבל את הביצועים המובטחים חייבים להריץ אותו דרך ספריית bitnet.cpp היעודית ב־C++ או להשתמש בגרסת GGUF שפורסמה בנפרד.

מבחינת חומרה, המודל רץ ישירות על מעבדים פשוטים כמעט בלי לתפוס זיכרון עבודה. אם אתם מחפשים רק לבדוק תגובות של מודל גדול ומורכב עם חלון הקשר עצום בלי להתעסק בקימפול קבצי C++, עדיף לשלם לפי טוקן ל־API חיצוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="microsoft/bitnet-b1.58-2B-4T")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, מה שאומר שמותר להשתמש בו לכל מטרה, כולל מוצרים מסחריים, שינוי קוד והפצה מחדש, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗