GPT
M

MegaBeam-Mistral-7B-512k

קוד פתוח

aws-prototypingapache-2.02024-07-30

  • transformers
  • safetensors
  • mistral
  • text-generation
  • conversational

גרסה מורחבת של מיסטרל שמסוגלת לקרוא חצי מיליון טוקנים בלי לגדול במספר הפרמטרים. היא מתאימה למי שחייב לעבד מסמכים ענקיים או קודי מקור שלמים על מודל מקומי קומפקטי.

  • 7.2Bפרמטרים
  • 524,288טוקנים בהקשר
  • 13.5 GBמשקל הקבצים
  • 8,375הורדות בחודש

מה זה

הבסיס כאן הוא Mistral 7B Instruct v0.2 שעבר אימון ייעודי להרחבת חלון ההקשר לגודל של 524,288 טוקנים. הרעיון הוא לתת מענה למשימות ארוכות בלי לשלם על מודלי ענק של עשרות מיליארדי פרמטרים.

בבדיקת Needle In A Haystack הוא הוציא ציון מושלם של מאה אחוזים בשליפת נתונים בודדים מתוך הטקסט. במבחן RULER הוא שמר על ממוצע של 88.7 נקודות, והצליח להחזיק ביצועים יציבים של מעל 82 נקודות גם באורך של 128 אלף טוקנים, איפה שמיסטרל המקורי כבר צנח לאזור ה־13 נקודות.

מתאים ל

  • ניתוח מאגרי קוד שלמים

    טעינת עשרות קבצים מתוך מאגר גיט בבת אחת כדי להבין תלויות ולעזור בקליטת מפתחים.

  • שליפת מידע ממסמכים ענקיים

    איתור פרטים ספציפיים מתוך טקסטים ארוכים במיוחד, משימה שבה הוא הגיע לדיוק מלא במבחני השליפה.

  • מענה על שאלות מתוך תמלילים

    הפקת תשובות מקבצי טקסט ארוכים בלי צורך לחלק אותם למקטעים קטנים במערכות חיפוש חיצוניות.

איפה זה נופל

היכולת לאחזר נתון בודד לא הופכת אותו לגאון. במבחן InfiniteBench הוא קיבל 0 אחוז במשימת Math.Calc ורק 2 אחוזים ב־Code.Run, מה שאומר שהוא לא מסוגל לעקוב אחרי חישובים או הרצת קוד מורכבת מתוך הטקסט. באגרגציה מסוג cwe הוא צונח מ־98.2 נקודות ב־4k ל־0.94 בלבד ב־128k. יוצרי המודל לא מפרטים על אילו נתונים הוא אומן או באילו שפות הוא שולט מעבר לאנגלית ולסינית שנבדקו במבחנים, ומציינים רק שחובה לבצע הערכת איכות ועמידה ברגולציה באופן עצמאי.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב מקומי עם כרטיס מסך אחד?

לא באורך המלא. המשקלים עצמם שוקלים 13.5 ג'יגה בייט ודורשים bfloat16, אבל הזיכרון שנחוץ לניהול חצי מיליון טוקנים מחייב שמונה כרטיסים גרפיים חזקים במקביל. על כרטיס בודד תוכלו להריץ אותו רק בהקשר קצר מאוד שמבטל את היתרון שלו.

האם הוא מתאים לחישובים והרצת קוד מתוך טקסט?

ממש לא. המבחנים שלו ב־InfiniteBench הראו ציונים אפסיים במתמטיקה ובמעקב אחרי ריצת קוד, כך שאי אפשר לסמוך עליו בהיגיון חישובי ארוך אלא בעיקר בחיפוש, תמצות ושליפת עובדות.

איך מריצים

כדי להריץ אותו בהקשר המלא צריך חומרה רצינית מאוד בגלל זיכרון ה־KV Cache. הדוגמה הרשמית דורשת שרת עם שמונה מאיצים, כמו שרת p4d.24xlarge, ומריצה עליו שרת vLLM עם tensor-parallel-size 8. אם מגבילים את האורך ל־288,800 טוקנים, אפשר להסתפק במכונת g5.48xlarge עם שמונה כרטיסי A10G.

אפשר להרים אותו גם כנקודת קצה ב־SageMaker עם DJL. אם אין לכם גישה לאשכול שרתים כזה עם שמונה כרטיסים גרפיים פנויים, זול ופשוט יותר לפנות ל־API מסחרי של מודל ענן במקום להחזיק תשתית כבדה.

from transformers import pipeline

pipe = pipeline("text-generation", model="aws-prototyping/MegaBeam-Mistral-7B-512k")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, להפיץ אותם מחדש ולשלב אותם במוצרים סגורים. התנאים היחידים הם שמירה על הודעת זכויות היוצרים והצהרת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗