GPT
B

Beyonder-4x7B-v2

קוד פתוח

mlabonneother2024-01-05

  • transformers
  • safetensors
  • mixtral
  • text-generation
  • moe

שילוב של ארבעה מודלים שונים לתוך ארכיטקטורת מומחים אחת. אתם מקבלים יכולות של מודל ענק עם זמן ריצה של מודל בינוני, בלי לשלם על שמונה מומחים מלאים.

  • 24Bפרמטרים
  • 8,192טוקנים בהקשר
  • 45.0 GBמשקל הקבצים
  • 80הורדות בחודש

מה זה

הפרויקט הזה מחבר ארבעה מודלים של 7B מבוססי קוד פתוח באמצעות כלי המיזוג mergekit. במקום לאמן רשת מאפס, הוא מגדיר מומחה ייעודי לשיחה כללית מבוסס OpenChat, מומחה לקוד מבוסס CodeNinja, מומחה לכתיבה ומשחקי תפקידים מבוסס PiVoT, ומומחה למתמטיקה מבוסס WizardMath. כשהוא מקבל קלט, הנתב בוחר שני מומחים בלבד ומריץ רק אותם.

במבחני ביצועים הוא עוקף את המודלים הבודדים שהרכיבו אותו ומציג תוצאה ממוצעת של 57.13 במבחני Nous. הוא מגיע קרוב מאוד לביצועים של מודלים מונוליטיים של 34B, למרות שבפועל מופעלים בכל רגע רק כ־12 מיליארד פרמטרים. ההבדל המרכזי מול מודלים דומים ברשת הוא השימוש בארבעה מומחים ממוקדים במקום שמונה, מה שמקטין את צריכת הזיכרון הכוללת.

מתאים ל

  • כתיבה ועריכת קוד

    מכיל מומחה ייעודי שמבוסס על CodeNinja ומיועד לפתרון בעיות פיתוח באלגוריתמיקה ובפייתון.

  • משחקי תפקידים וסיפורים

    מנתב בקשות עלילתיות למודל PiVoT שמתמחה ביצירת דיאלוגים ודמויות בצורה חופשית.

  • עוזר שיחה כללי מקומי

    רץ ביעילות על חומרה בינונית בזכות הפעלה של שני מומחים בלבד בכל תשובה.

איפה זה נופל

במבחני היגיון מורכבים המודל מציג חולשה ברורה. במבחן AGI-Eval על שאלות מתמטיות של ה־SAT הוא נעצר על 34.55 אחוז דיוק בלבד, ובחלק ממבחני הלוגיקה והמעקב של Bigbench הוא יורד לאזורי ה־20 אחוז. שילוב של מודלים במיזוג ידני לא מתקן טעויות שורשיות בפתרון בעיות רב־שלביות, ולכן הוא נוטה לטעות בחישובים מורכבים או בשרשראות היסק ארוכות.

אותה משפחה

Beyonder יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

כמה זיכרון מחשב צריך בשביל להריץ אותו מקומית?

הקבצים המקוריים שוקלים 45 גיגה, מה שאומר שצריך כרטיס תעשייתי יקר. בגרסת GGUF מכווצת ל־4 ביט אפשר להסתפק ב־16 גיגה זיכרון וידאו ולהריץ אותו באופן סביר על מחשב אישי חזק.

האם הוא מתאים לפתרון בעיות מתמטיות קשות?

למרות שהוא משלב את WizardMath, המבחנים מראים ציונים נמוכים סביב 34 אחוז במבחני SAT מתמטיים. לא כדאי להסתמך עליו בחישובים מדויקים ללא אימות חיצוני.

למה להעדיף אותו על פני מודל מלא של 34B?

הוא צורך הרבה פחות כוח עיבוד פר טוקן כי הוא מפעיל רק שני מומחים בזמן אמת. אתם מקבלים איכות קרובה לקבוצת ה־34B במהירות של מודל קטן בהרבה.

איך מריצים

כדי להריץ את הגרסה המלאה ב־bfloat16 תצטרכו 45 גיגה־בייט של זיכרון כרטיס מסך, מה שמחייב חומרה כבדה כמו שני כרטיסי A100 או RTX 4090 מרובים. אם תבחרו לכווץ אותו ל־4 ביט בעזרת bitsandbytes, אפשר לדחוס אותו לכרטיס T4 בודד עם 16 גיגה־בייט זיכרון, למשל ב־Colab חינמי.

הקהילה יצרה לו גרסאות מכווצות בפורמטים GGUF, AWQ, GPTQ ו־EXL2. אם אתם מחפשים להריץ מקומית במחשב אישי, גרסת ה־GGUF היא הדרך היחידה לקבל קצב סביר בלי לשרוף את המשאבים, ואם אין לכם כרטיס ייעודי, עדיף לפנות לפתרון מנוהל.

from transformers import pipeline

pipe = pipeline("text-generation", model="mlabonne/Beyonder-4x7B-v2")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ללא פירוט ישיר בקבצים. במצב כזה אתם כבולים לרישיונות של ארבעת מודלי המקור שמהם הוא נבנה. לחלקם עשויות להיות הגבלות מסחריות, כך שאסור לשלב אותו במוצר מסחרי לפני שבודקים את תנאי השימוש של WizardMath, CodeNinja ושאר הרכיבים.

הרישיון המלא בעמוד המודל ↗