GPT
M

MistralTrix-v1

קוד פתוח

CultriXרישיון לא דווח2024-01-03

  • transformers
  • safetensors
  • mistral
  • text-generation
  • merge

שילוב של מודל ממוזג עם אימון העדפה מהיר שיצר תוצאות גבוהות במבחנים. מפתח עצמאי לקח בסיס קיים ודחף אותו לראש הטבלאות בגודל שבעה מיליארד פרמטרים.

  • 32,768טוקנים בהקשר
  • 16.7 GBמשקל הקבצים
  • 129הורדות בחודש
  • 111לייקים

מה זה

הבסיס כאן הוא מודל ממוזג שעבר כוונון נוסף בשיטת DPO, על בסיס נתונים של אינטל ובמבנה שיחה של ChatML. המפתח מעיד בעצמו שמדובר בניסוי ביתי לפי מדריך קיים, אבל התוצאות במבחנים הסטנדרטיים הפתיעו אותו והציבו את המודל בצמרת הקטגוריה בזמן פרסומו.

הציונים הגבוהים בבדיקות כמו TruthfulQA עם מעל 70 ו־HellaSwag עם 88 מראים על יכולת טובה להימנע מחזרות ולהתמודד עם שאלות ידע והיגיון באנגלית. יחד עם זאת, 65 ב־MMLU ו־62 במתמטיקה מראים שהיכולת שלו להסיק מסקנות מורכבות נשארת מוגבלת לתחום הרגיל של מודלים בגודל הזה.

מתאים ל

  • עוזר שיחה מקומי באנגלית

    אימון ה־DPO נעשה על בסיס נתוני שיחה בפורמט ChatML, מה שנותן מענה טוב וישיר בדיאלוג.

  • בדיקת יכולות מיזוג ו־DPO

    דוגמה טובה לאיך כוונון קצר וזול של מודל ממוזג יכול להקפיץ ציונים במבחנים פתוחים.

  • מענה על שאלות ידע כללי

    ציונים יפים במבחני היגיון וידע הופכים אותו למתאים למשימות שליפה ותשובות קצרות באנגלית.

איפה זה נופל

היוצר עצמו מצהיר בגלוי שהוא חובב ללא רקע מקצועי בתחום, ושהאימון ארך שעה אחת בלבד עם 200 צעדים על כרטיס בודד ב־Colab. מעבר לזה, אורך הרצף המרבי בזמן האימון הוגבל ל־1,536 טוקנים בלבד, כך שלמרות שחלון ההקשר המקורי של הארכיטקטורה מגיע ל־32 אלף טוקנים, המודל לא אומן להתמודד עם טקסטים ארוכים באמת. אין פה שום התאמה מתועדת לעברית, ולפני שמשלבים אותו במערכת אמיתית צריך לבדוק היטב אם התוצאות היפות במבחנים מחזיקות מעמד מחוץ לתרחישים סינתטיים.

שאלות
נפוצות

האם המודל ינצל בפועל חלון הקשר של 32 אלף טוקנים?

לא מומלץ לבנות על זה. הארכיטקטורה תומכת בחלון כזה, אבל שלב ה־DPO אומן עם אורך מרבי של 1,536 טוקנים בלבד. מעבר לטווח הזה המודל עלול לאבד אחיזה או לייצר פלטים פחות איכותיים.

האם אפשר להריץ אותו על מחשב נייד חזק?

הקבצים המקוריים כבדים מדי לרוב המחשבים הניידים בלי כרטיס גרפי ייעודי של 24 גיגהבייט. אם אתם רוצים להריץ אותו מקומית, עדיף להוריד את גרסאות ה־GGUF שהמפתח יצר עבור מנועים קלים כמו llama.cpp.

איך מריצים

המשקל המלא של הקבצים מגיע ל־16.7 גיגהבייט בדיוק של float16, כך שכדי להריץ אותו בצורה נקייה ב־transformers תצטרכו כרטיס מסך עם לפחות 24 גיגהבייט זיכרון. אם המטרה היא להריץ מקומית על מחשב אישי או חומרה צנועה יותר, המפתח העלה גרסאות מכווצות בפורמט GGUF בעמוד נפרד.

מי שרק בונה שירות וצריך זמינות יציבה בלי לנהל תשתית, יעדיף לפנות ל־API של מודל מסחרי גדול. המודל הזה מתאים למי שרוצה להריץ שרת עצמאי על חומרה מקומית לצורכי מחקר, ניסוי או שימוש פנימי.

from transformers import pipeline

pipe = pipeline("text-generation", model="CultriX/MistralTrix-v1")
print(pipe("שלום"))

הרישיון

הרישיון לא דווח בעמוד המודל. במצב כזה אין אישור שימוש מפורש, לא לצרכים מסחריים ולא להפצה בקוד פתוח. מי ששוקל להכניס אותו למוצר מסחרי לוקח סיכון משפטי, ועדיף לוותר על שימוש בייצור עד שהיוצר יפרסם תנאי שימוש ברורים.

הרישיון המלא בעמוד המודל ↗