GPT
C

cpm-bee-10b

קוד פתוח

openbmbרישיון לא דווח2023-05-26

  • transformers
  • pytorch
  • cpmbee
  • feature-extraction
  • text-generation

מודל בסיס דו לשוני של עשרה מיליארד פרמטרים, שנבנה במיוחד עבור אנגלית וסינית ואומן על טריליון טוקנים. הוא מיועד למי שמחפש מודל פתוח לעיבוד שפות אלו עם אפשרות כוונון עצמאי.

  • 17.9 GBמשקל הקבצים
  • 190הורדות בחודש
  • 173לייקים
  • 48שכבות

מה זה

מדובר במודל בסיס של חברת openbmb שמבוסס על ארכיטקטורת CpmBeeForCausalLM עם 48 שכבות. הוא אומן מאפס על מאגר נתונים שעבר סינון וניקוי קפדניים, בהיקף של יותר מטריליון טוקנים. המודל מתמקד בשתי שפות בלבד, אנגלית וסינית, בלי ניסיון לכסות שפות נוספות.

בניגוד למודלים שמגיעים רק כמשקלים גולמיים, הוא נשען על האקוסיסטם של OpenBMB שכולל סקריפטים מותאמים לדחיסה, אימון ופריסה. המודל עצמו הוא מודל בסיס למשימות יצירת טקסט כלליות, אך המפתחים מציינים שהוא מהווה בסיס לגרסאות המשך שמכוונות לשיחה ולשימוש בכלים חיצוניים.

מתאים ל

  • בסיס לכוונון בסינית ואנגלית

    הוא מאוזן מראש לשתי השפות ואומן על טריליון טוקנים, מה שחוסך אימון מקדים יקר.

  • הסקה מקומית על שרת פרטי

    משקל של 17.9 גיגה בייט מאפשר פריסה מלאה על חומרה מקומית ייעודית בארגון.

  • יצירת טקסט ומשימות שפה כלליות

    מתאים להשלמת טקסטים אוטומטית ישירות מתוך קוד פייתון באמצעות מנגנון התבניות שלו.

איפה זה נופל

המודל הזה הוכשר אך ורק על אנגלית וסינית, כך שאין לו שום תמיכה בעברית או בשפות אחרות. מעבר לכך, מדובר במודל בסיס גולמי, כלומר הוא מייצר המשך לטקסט ולא מגיב כעוזר שיחה ממושמע בלי כוונון עדין מוקדם. דפוס הקלט והפלט שלו בקוד דורש מבנה מילוני ייעודי ולא מחרוזת טקסט רגילה, מה שמסבך את השילוב שלו במערכות קיימות.

שאלות
נפוצות

האם אפשר לעבוד איתו בעברית?

לא. המודל אומן והוגדר עבור אנגלית וסינית בלבד, והוא לא יפיק פלט הגיוני בעברית.

האם המודל מגיע מוכן לשיחה כמו צ'אטבוט?

לא באופן ישיר. זהו מודל בסיס שמשלים טקסט, ובשביל לקבל התנהגות של עוזר שיחה תצטרכו לבצע לו כוונון עדין או להשתמש בגרסת המשך.

איך מריצים

המשקלים תופסים 17.9 גיגה בייט ומחולקים ל־12 קבצים, כך שצריך כרטיס מסך עם לפחות 24 גיגה בייט של זיכרון וידאו כדי לטעון אותו במלואו להסקה פשוטה. הטעינה בספריית transformers דורשת הפעלה של trust_remote_code מפני שמדובר בארכיטקטורה מותאמת אישית של הפרויקט.

למי שמתכנן לאמן או לבצע כוונון עדין, המפתחים ממליצים להשתמש בספריות bmtrain, accelerate או deepspeed לחלוקת עומסים ומקביליות על פני כמה כרטיסים. אם אתם צריכים רק שאילתות בודדות באנגלית ולא מפתחים מערכת מקומית או מבוססת סינית, עדיף לפנות ל־API חיצוני מוכן במקום להחזיק שרת ייעודי למודל הזה.

from transformers import pipeline

pipe = pipeline("text-generation", model="openbmb/cpm-bee-10b")
print(pipe("שלום"))

הרישיון

בדף המודל בהאגינג פייס לא דווח רישיון רשמי בשדה המתאים, למרות שבתיאור הטקסטואלי המפתחים מצהירים שהוא מודל קוד פתוח שפתוח לשימוש מסחרי. מבחינה משפטית, היעדר קובץ רישיון מוגדר יוצר סיכון, ומומלץ לבדוק את תנאי המאגר המקורי לפני שילוב שלו בקוד מסחרי.

הרישיון המלא בעמוד המודל ↗