GPT
M

MistralLite

קוד פתוח

amazonapache-2.02023-10-16

  • transformers
  • pytorch
  • mistral
  • text-generation
  • text-generation-inference

גרסה מכווננת של מיסטרל 7B שפותחה באמזון כדי להתמודד עם טקסטים ארוכים במיוחד. היא פותרת את בעיית איבוד הריכוז של המודל המקורי כשהקלט עובר ארבעת אלפים טוקנים.

  • 32,768טוקנים בהקשר
  • 13.5 GBמשקל הקבצים
  • 19,669הורדות בחודש
  • 435לייקים

מה זה

מיסטרל המקורי הציג ביצועים מצוינים לגודל שלו, אבל כשדחפו אליו טקסטים מעבר לכמה אלפי טוקנים, היכולת שלו לשלוף מידע צנחה לאפס. אמזון לקחו את גרסת הבסיס, הרחיבו את חלון ה־sliding window ל־16,384, שינו את הגדרות ה־RoPE, ואימנו אותו מחדש על טקסטים ארוכים של עד 16K טוקנים. המודל מסוגל לקבל עד 32K טוקנים בקלט ומיועד למשימות של סיכום, שאלות ותשובות, ושליפת נתונים ממסמכים כבדים.

התוצאות במבחני שליפה מראות בדיוק את ההבדל הזה. במבחן שליפת נושא באורך של כ־11 אלף טוקנים, המודל המקורי קרס ל־0% דיוק, בזמן שהגרסה הזו שמרה על 100%. במבחן שליפת שורות באורך של כ־12.6 אלף טוקנים, המודל השיג 60% לעומת 30% בלבד במודל הרגיל. גם במענה על שאלות מתוך טקסטים ארוכים נרשם דיוק של 64.4% לעומת 44.3%. זה עדיין מודל קומפקטי יחסית, אבל כזה שלא שוכח מה קרא עמוד קודם.

מתאים ל

  • סיכום מסמכים טכניים

    היכולת לעבד מעל עשרת אלפים טוקנים ברצף בלי לאבד את ההקשר מתאימה לניתוח מדריכים או דוחות ארוכים.

  • שליפת נתונים ומספרי מפתח

    המודל שומר על 100% דיוק במבחני passkey עד עשרת אלפים טוקנים, מה שמתאים לאיתור מידע ספציפי בתוך טקסט גדול.

  • מענה על שאלות ב־RAG

    אפשר להזין מקטעים רבים שנשלפו מבסיס נתונים וקטורי בלי לחשוש שהמודל יתעלם מהפסקאות המוקדמות.

איפה זה נופל

המודל אומן על אנגלית בלבד, ואין שום תיעוד או בדיקה לגבי תמיכה בשפות אחרות. מפתחים ישראלים שרוצים לעבד מסמכים בעברית יגלו מהר מאוד שהתוצאות לא שמישות בלי אימון נוסף. בנוסף, למרות שהקונטקסט התאורטי מגיע ל־32K טוקנים, האימון עצמו בוצע בפועל רק עד 16K טוקנים, ולכן הביצועים מעבר לטווח הזה אינם מובטחים. במבחן שליפת שורות, ככל שהטקסט מתארך, הדיוק יורד מ־98% בארבעת אלפים טוקנים ל־60% בלבד באזור ה־12 אלף, כך שעדיין יש סיכוי ממשי להזיות ואיבוד מידע בטקסטים מורכבים.

שאלות
נפוצות

איזה פורמט פרומפט המודל דורש?

המודל רגיש מאוד למבנה הפרומפט ודורש תבנית קבועה מראש. יש לעטוף את שאלת המשתמש בתגית prompter ולסגור בתגית s, ולאחר מכן לפתוח תגית assistant בשביל התשובה. שימוש בפרומפט רגיל יוביל לתשובות שבורות.

האם הוא מבין עברית?

כרטיס המודל מציין אנגלית בלבד כשפת האימון והבדיקה. טקסטים בעברית יובילו לפלט משובש, טוקניזציה לא יעילה שסתם תנפח את חלון ההקשר, והזיות.

איך מריצים

המשקל הכולל עומד על 13.5 גיגה־בייט בפורמט bfloat16. כדי להריץ אותו בהסקה בצורה נוחה עם קונטקסט מלא, צריך כרטיס מסך עם לפחות 24 גיגה זיכרון, כמו למשל מופע g5.2x בודד ב־AWS. המודל נתמך ישירות בספריות המקובלות: transformers עם FlashAttention-2, שרתי vLLM, או קונטיינר של TGI.

אם הקלט שלכם עובר 12K טוקנים, כרטיס המודל ממליץ להשתמש בקונטיינר מותאם אישית של TGI ולא בהגדרות ברירת המחדל. בנוסף, בהרצה ראשונה יש תקופת חימום של עשרות שניות עד שהשרת מתייצב ומחזיר תשובות מהר.

from transformers import pipeline

pipe = pipeline("text-generation", model="amazon/MistralLite")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקולות, והפצה מחדש בתוך מוצרים. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי, בלי אחריות משפטית מצד המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗