GPT
C

Chinese-Mixtral-8x7B

קוד פתוח

HIT-SCIRapache-2.02024-01-15

  • transformers
  • safetensors
  • mixtral
  • text-generation
  • model-index

הרחבה של מיקסטרל לסינית עם טוקנייזר מותאם ואימון מקדים נוסף. הוא פונה למי שצריך מודל תערובת מומחים דו-לשוני באנגלית וסינית לפיתוח המשך.

  • 47Bפרמטרים
  • 32,768טוקנים בהקשר
  • 87.4 GBמשקל הקבצים
  • 8,489הורדות בחודש

מה זה

מדובר בהתאמה של מיקסטרל המקורי לעבודה יעילה עם סינית. הצוות הרחיב את אוצר המילים ל־57,000 טוקנים, מה שחתך את מספר הטוקנים שנדרשים לייצוג טקסט סיני ב־41.5 אחוז מול מודל הבסיס, ואימן אותו מחדש בשיטת QLoRA על 42 מיליארד טוקנים.

במבחני ידע סיניים כמו C-Eval ו־CMMLU הוא מגרד אזור של 51 עד 52 נקודות, רמה דומה למודל TigerBot-13B שעבר אימון על נפח נתונים גדול בהרבה. באנגלית הוא שומר על החוזק המקורי של מיקסטרל עם 69.8 ב־MMLU ו־65.69 ב־HellaSwag, כך שהוא עוקף מודלים מקבילים של 13 מיליארד פרמטרים בחלק האנגלי.

מתאים ל

  • בסיס לכוונון צ'אט בסינית

    המודל כולל טוקנייזר סיני יעיל ומשמר יכולות באנגלית, מה שנותן נקודת פתיחה טובה לאימון SFT.

  • עיבוד מסמכים דו-לשוניים

    חלון של 32,768 טוקנים ודחיסת טקסט סיני משופרת מאפשרים ניתוח טקסטים ארוכים בסינית ואנגלית.

  • השלמת טקסט סיני

    בתור מודל בסיס, הוא מתאים ליצירה חופשית והמשך כתיבה מבוססת הקשר בסינית ללא פורמט שיחה.

איפה זה נופל

זהו מודל בסיס בלבד. הוא לא עבר התאמה להוראות (SFT) או יישור מול בני אדם, ולכן הוא לא יודע לענות לצ'אט כמו מוצר מוגמר ופשוט ימשיך טקסטים. בנוסף, מפתחי הפרויקט מציינים במפורש שהוא עלול לייצר טעויות עובדתיות ותכנים פוגעניים. מי שרוצה להשתמש בו ליישום קצה חייב להריץ עליו כוונון עדין למשימה ספציפית.

שאלות
נפוצות

האם אפשר להשתמש בו מיד כצ'אטבוט?

לא. המודל פורסם כמודל בסיס ולא כוונן למילוי הוראות. כדי לדבר איתו בצורת שאלות ותשובות, תצטרכו לאמן אותו קודם על דאטה-סט של הנחיות.

למה להעדיף אותו על פני מיקסטרל המקורי?

אם רוב הטקסט שלכם בסינית, הטוקנייזר שלו מכווץ את המילים בצורה יעילה יותר וחוסך 41.5 אחוז באורך הרצף. זה מאיץ את הריצה ומפנה מקום בהקשר.

איך מריצים

המשקל המלא הוא 87.4 גיגה-בייט, מה שמחייב לפחות 90 עד 100 גיגה-בייט זיכרון וידאו להרצה ב־bfloat16, למשל שילוב של שני כרטיסי A100 או H100. יש אפשרות להוריד רק את מתאם ה־LoRA ששוקל 2.7 גיגה-בייט ולמזג אותו ידנית למודל המקורי, או לחלופין לטעון את המשקלים בקוונטיזציה של 4 ביט דרך bitsandbytes כדי לדחוס את הדרישה לחומרה נגישה יותר.

אם אתם לא צריכים לאמן או לכוונן אותו על שרת ייעודי, עדיף להשתמש ב־API קיים של ספקי ענן שתומכים במיקסטרל במקום לתחזק שרת כבד רק בשביל שאילתות בודדות.

from transformers import pipeline

pipe = pipeline("text-generation", model="HIT-SCIR/Chinese-Mixtral-8x7B")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי מלא, שינוי קוד, הפצה ושילוב במוצרים סגורים. התנאים העיקריים דורשים לשמור על הצהרת זכויות היוצרים המקורית ולצרף עותק של הרישיון, בלי חובה לחשוף את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗