GPT
B

Baichuan-13B-Base

קוד פתוח

baichuan-incרישיון לא דווח2023-07-08

  • transformers
  • pytorch
  • baichuan
  • text-generation
  • custom_code

מודל בסיס דו לשוני של 13 מיליארד פרמטרים, שנבנה במיוחד לעבודה בסינית ואנגלית. הוא מציע אלטרנטיבה מהירה יותר לדור הראשון של לאמה בזכות קידוד מיקום שונה.

  • 24.7 GBמשקל הקבצים
  • 545הורדות בחודש
  • 187לייקים
  • 40שכבות

מה זה

הגרסה הזו היא מודל גולמי שלא עבר התאמה לשיחה, והוא אומן על 1.4 טריליון טוקנים בסינית ואנגלית. במבחני ידע והבנה בסינית כמו C-Eval ו־CMMLU הוא מציג יתרון ברור על פני דגמי 13B מקבילים מתקופתו, עם ממוצעים של 52.4 ו־55.3 לעומת אזור ה־30 של לאמה המקורית. באנגלית, לפי מבחן MMLU, הוא מגיע ל־51.6, שזה קרוב מאוד למה שקיבל ויקוניה באותו סדר גודל.

ההבדל הטכני המרכזי בארכיטקטורה שלו מול מתחרים הוא השימוש ב־ALiBi במקום ב־RoPE. לפי הבדיקות שהמפתחים מציגים, השינוי הזה חוסך חישובים ומעלה את קצב הייצור ל־25.4 טוקנים לשנייה בהשוואה ל־19.4 בלאמה 13B, שיפור מורגש של מעל שלושים אחוז במהירות הריצה.

מתאים ל

  • בסיס לכיול מודל בסינית

    הוא מציג ביצועים גבוהים במיוחד בסינית וכולל 1.4 טריליון טוקנים של דאטה איכותי כנקודת מוצא.

  • אימון מקומי לחברות

    מודל 13B שמאפשר לבצע fine-tuning מלא על חומרה סבירה יחסית בלי תלות חיצונית.

  • עיבוד טקסט דו-לשוני מהיר

    ארכיטקטורת ALiBi מאפשרת מהירות עיבוד של 25.4 טוקנים לשנייה במשימות אנגלית וסינית.

איפה זה נופל

זהו מודל בסיס בלבד, מה שאומר שהוא לא מבין פקודות ישירות, לא יודע לנהל שיחה, ונוטה להמשיך טקסט או לפלוט מלל לא מבוקר בלי אימון נוסף. התמיכה בשפות מוגבלת לחלוטין לסינית ואנגלית, כך שאין מה לבנות עליו לעיבוד עברית. חלון ההקשר מוגבל ל־4096 טוקנים, והמפתחים עצמם מזהירים שהם לא מסננים בעיות אבטחת מידע, הטעיות או סיכוני תוכן שעלולים לצוץ מהשימוש בו.

אותה משפחה

Baichuan יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה מתאים לעבודה בעברית?

לא. המודל אומן והוגדר רשמית רק עבור סינית ואנגלית. אוצר המילים ונתוני האימון שלו לא כוללים עברית ברמה שתאפשר שימוש סביר.

האם אפשר לשלוח לו שאלות בצ'אט ישר אחרי ההורדה?

לא, זהו מודל Base ולא Chat. הוא ימשיך את הטקסט שלכם במקום לענות לכם, ולכן לשיחה עדיף לקחת ישירות את Baichuan-13B-Chat או לאמן אותו בעצמכם.

האם מותר להשתמש בו באפליקציה מסחרית?

רק לאחר קבלת אישור. הרישיון דורש פנייה רשמית במייל לצוות הפיתוח וקבלת אישור בכתב לפני הפצה מסחרית.

איך מריצים

כדי להריץ אותו במשקל מלא של bfloat16 תצטרכו כרטיס מקצועי עם לפחות 28 עד 32 גיגה זיכרון גרפי, בהתחשב בכך שקבצי המשקולות לבדם תופסים כמעט 25 גיגה. למי שמחזיק כרטיסים ביתיים כמו RTX 3090 עם 24 גיגה, קיימות גרסאות מקוונטטות של 4 ו־8 ביט שמורידות את דרישות הזיכרון באופן משמעותי ומאפשרות להריץ לוקאלית.

אם אתם לא צריכים לאמן או לכייל את המודל על דאטה פרטי משלכם, אין טעם להחזיק שרת ייעודי בשבילו. צריכת מודל גנרי דרך ספק ענן תהיה זולה ופשוטה בהרבה מתחזוקת החומרה הזו בעצמכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="baichuan-inc/Baichuan-13B-Base")
print(pipe("שלום"))

הרישיון

בעמוד המודל לא מוגדר רישיון רשמי מוכר, אלא הפניה להסכם קהילתי ייעודי של החברה. המחקר האקדמי פתוח, אך שימוש מסחרי מחייב פנייה יזומה במייל וקבלת אישור כתוב מהיוצרים. בלי האישור הזה ביד, אסור לשלב אותו במוצר מסחרי.

הרישיון המלא בעמוד המודל ↗