GPT
B

BitCPM-CANN-8B

קוד פתוח

openbmbapache-2.02026-05-15

  • transformers
  • pytorch
  • minicpm
  • text-generation
  • conversational

מודל שפותח כדי לבדוק קוונטיזציה קיצונית של 1.58 ביט בזמן אימון מלא. מי שמושך אותו מחפש להריץ משקלי טרנארי בפורמט רגיל בלי ליבות מיוחדות.

  • 32,768טוקנים בהקשר
  • 15.3 GBמשקל הקבצים
  • 10,092הורדות בחודש
  • 102לייקים

מה זה

מדובר במודל שפה שאומן ישירות עם משקלים טרנאריים של מינוס אחת, אפס ואחת על גבי חומרת Ascend 910B של וואווי. המטרה כאן היתה לחסוך מקום בלי לספוג את הנפילה הרגילה שמגיעה כשמכווצים מודל קיים אחרי האימון. הוא שומר על מבנה סטנדרטי של MiniCPM ומאפשר עבודה ישירה עם ספריית transformers הרגילה.

במבחני הביצועים הוא שומר על 95.7% מהיכולת של גרסת המקור המלאה שלו, עם ממוצע של 77.84 נקודות מול 81.31 בגרסת הבסיס על פני 11 מבחנים. בבדיקות ידע כללי ומבחני שאלות הוא נשאר צמוד מאוד למקור, אבל במשימות של חשיבה מתמטית וקוד יש ירידה מורגשת, כמו ב־GSM8K שבו הוא יורד מ־91.51 ל־85.75 נקודות.

מתאים ל

  • מחקר על משקלי 1.58 ביט

    מאפשר לבחון השפעה של אימון טרנארי על ארכיטקטורת 8B ישירות בסביבת פייתון רגילה.

  • פיתוח מנועי הסקה ייעודיים

    בסיס מתאים לבניית קרנלים מותאמים אישית שמחלצים את הערכים הטרנאריים לזיכרון נמוך.

  • עיבוד טקסט באנגלית ובסינית

    מציג תוצאות טובות בהבנת הנקרא וידע כללי בשפות שבהן אומן, קרוב מאוד למודל המלא.

איפה זה נופל

הקובץ הזה לא נותן חיסכון מיידי בזיכרון מהקופסה, והמשקל שלו עדיין דורש משאבים של מודל מלא. הירידה ביכולות מורגשת בעיקר בהיגיון מורכב, כפי שרואים בציוני BBH שנפלו מ־76.72 ל־70.70 ובמבחני MMLU. בנוסף, הוא אומן ותועד רק באנגלית ובסינית, ללא תמיכה מוגדרת בעברית, כך שלא כדאי לבנות עליו לעיבוד שפה מקומי בלי בדיקה מקיפה של התוצרים.

אותה משפחה

BitCPM-CANN יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

למה הקובץ שוקל מעל 15 גיגה אם המודל מוגדר כ־1.58 ביט?

המשקלים במאגר שמורים בדיוק של bfloat16 כדי שכל סביבה סטנדרטית תוכל לקרוא אותם בלי הרחבות מיוחדות. הערכים עצמם עברו עיגול לשלושה מצבים בזמן האימון, אך הייצוג בקובץ נשאר של מספר צף. כדי לקבל חיסרון אמיתי במשקל על הדיסק ובזיכרון צריך להשתמש בגרסת ה־GGUF.

איך הביצועים שלו בהשוואה לגרסת המקור הרגילה?

הוא שומר על כ־96 אחוזים מהיכולת הכוללת של MiniCPM4 המקביל לו. במשימות ידע כללי ושאלות אמריקאיות ההבדל זניח, אך במשימות שדורשות פתרון שלבי כמו מתמטיקה יש פגיעה של מספר אחוזים בציונים.

האם הוא מתאים לעבודה בעברית?

המודל הוגדר ואומן עבור אנגלית וסינית בלבד לפי נתוני המפתח. הוא לא עבר התאמה לעברית, ולכן לא מומלץ להסתמך עליו למשימות שדורשות הבנה או יצירה של טקסט מקומי.

איך מריצים

המשקלים במאגר הזה שמורים בפורמט bfloat16 רגיל ותופסים 15.3 גיגה בייט, כי מדובר בקוונטיזציה מדומה. המשמעות היא שאתם צריכים כרטיס מסך עם לפחות 16 עד 24 גיגה בייט זיכרון כדי לטעון אותו, בדיוק כמו כל מודל 8B רגיל, ולא תראו כאן חיסכון בזיכרון בטעינה רגילה דרך transformers.

אם המטרה היא לנצל את החיסכון של פי שישה בזיכרון שהחוקרים מדברים עליו, צריך להוריד את גרסת ה־GGUF של המודל שזמינה במאגר נפרד. להרצה שוטפת בייצור ללא חומרה מקומית חזקה, עדיף לפנות ל־API חיצוני שמריץ מודלים בגודל דומה, אלא אם כן אתם רוצים לחקור ספציפית את ההתנהגות של משקלי 1.58 ביט.

from transformers import pipeline

pipe = pipeline("text-generation", model="openbmb/BitCPM-CANN-8B")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗