GPT
B

Baichuan-7B

קוד פתוח

baichuan-incרישיון לא דווח2023-06-13

  • transformers
  • pytorch
  • baichuan
  • text-generation
  • custom_code

מודל בסיס פתוח של 7 מיליארד פרמטרים שאומן על 1.2 טריליון טוקנים. הוא פונה למי שצריך ביצועים גבוהים בסינית לצד אנגלית על חומרה מקומית נגישה.

  • 4,096טוקנים בהקשר
  • 13.0 GBמשקל הקבצים
  • 19,175הורדות בחודש
  • 841לייקים

מה זה

המודל הזה נבנה כמודל בסיס דו לשוני שמכוון בעיקר לסינית ולאנגלית. הוא מבוסס על ארכיטקטורת טרנספורמר עם 32 שכבות וגודל הקשר של 4,096 טוקנים, תוך שימוש במבנה דומה לזה של LLaMA הכולל קידוד מיקום בשיטת RoPE, שכבות SwiGLU ונרמול מוקדם מבוסס RMSNorm.

במבחני ביצועים בסינית הוא עוקף מודלים מערביים מקבילים. ב־C-Eval הוא הגיע לציון ממוצע של 42.8 בבדיקת 5-shot לעומת 27.1 של LLaMA המקורי, ובמבחני בחינות הכניסה לאוניברסיטה בסין (Gaokao) רשם 36.24 לעומת 27.81. גם באנגלית הוא הציג יתרון מסוים עם 42.3 ב־MMLU לעומת 35.1 של LLaMA בגודל זהה, מה שמעיד על הבנה רחבה יחסית של מושגים ולא רק יתרון שפתי צר.

מתאים ל

  • עיבוד טקסטים בסינית

    אידיאלי לתרגום, מיצוי מידע וניתוח תוכן מורכב בסינית בזכות אימון ייעודי על דאטה מקומי.

  • בסיס לאימון מותאם אישית

    מתאים לביצוע finetuning למשימות ארגוניות קצרות בזכות ארכיטקטורה מוכרת וקוד אימון פתוח שהופץ איתו.

  • פתרון בעיות באנגלית ובסינית

    ציונים גבוהים בבנצ'מרקים כמו MMLU ו־C-Eval הופכים אותו לטוב יחסית למשימות סיווג ופתרון שאלות סגורות.

איפה זה נופל

זהו מודל בסיס ולא מודל שיחה שעבר כוונון להוראות. המשמעות היא שהוא משלים טקסט ולא בהכרח יודע לענות לשאלות ישירות בסגנון צ'אט בלי שתתנו לו דוגמאות בפרומפט או תעשו לו finetuning. המפתחים עצמם מזהירים שהוא עלול לייצר מידע שגוי לחלוטין, שאין להסתמך עליו לעובדות מדויקות, ושהוא עלול לפלוט תוכן פוגעני או מוטה שנאסף ממאגרי המידע הציבוריים שעליהם אומן. הוא לא כולל מנגנוני בטיחות פנימיים ואינו מתאים לעברית.

אותה משפחה

Baichuan יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין עברית?

המודל אומן על סינית ואנגלית בלבד ולא מיועד לעברית. פנייה אליו בעברית תוביל לפלטים שבורים או להזיות, ואין להסתמך עליו לשום מטלה בשפה המקומית.

האם אפשר להשתמש בו ישירות כצ'אטבוט?

לא מומלץ בלי התאמות. המודל הוא מודל בסיס למילוי והמשך טקסט, כך שהוא צריך כוונון ייעודי להוראות כדי להתנהג כמו עוזר וירטואלי.

למה נדרש הדגל trust_remote_code בהרצה?

הארכיטקטורה שלו מוגדרת כקוד מותאם אישית שנמצא בתוך המאגר ולא כחלק מהקוד המובנה של ספריית transformers. הדגל מאפשר לפייתון להריץ את קובץ המודל המקומי.

איך מריצים

המשקל הכולל של הקבצים עומד על 13.0 גיגה בייט, והמודל נשמר בדיוק float32. בשביל להריץ אותו בהסקה רגילה תצטרכו כרטיס מסך עם לפחות 16 עד 24 גיגה בייט של זיכרון וידאו, אלא אם כן תבצעו קוונטיזציה לדיוק נמוך יותר. הרצה מקומית מתבצעת דרך ספריית transformers הרגילה של פייתון, אך מחייבת להגדיר trust_remote_code=True כי הקוד הספציפי של המודל יורד יחד איתו.

אם אתם לא צריכים לאמן את המודל מחדש על נתונים משלכם או להחזיק את המידע מאחורי פיירוול מקומי קפדני, עדיף להשתמש בפתרונות ענן. ניהול שרת עם מעבד גרפי מתאים בשביל מודל 7B דורש תחזוקה שלא תמיד מצדיקה את עצמה בהיקפי עבודה נמוכים.

from transformers import pipeline

pipe = pipeline("text-generation", model="baichuan-inc/Baichuan-7B")
print(pipe("שלום"))

הרישיון

במטה הדאטה של הדף מופיע שהרישיון לא דווח, אך בתיעוד יש קישור לקובץ PDF עם תנאי השימוש הרשמיים. המפתחים מצהירים שהרישיון מתיר שימוש מסחרי בניגוד לגרסאות מוקדמות של LLaMA, אך ללא בדיקה מדוקדקת של מסמך הרישיון המקורי בסינית, מסוכן לשלב אותו במוצר מסחרי סגור.

הרישיון המלא בעמוד המודל ↗