GPT
B

BLOOMChat-176B-v1

קוד פתוח

sambanovasystemsother2023-05-10

  • transformers
  • pytorch
  • bloom
  • text-generation
  • text-generation-inference

גרסת שיחה רב לשונית שנבנתה על בסיס מודל ענק עם 176 מיליארד פרמטרים. היא פונה למי שמחפש מודל פתוח לשיחה ולשאלות ותשובות בכמה שפות ללא תלות בספקי ענן סגורים.

  • 335 GBמשקל הקבצים
  • 110הורדות בחודש
  • 365לייקים

מה זה

בבסיס המודל נמצא BLOOM המקורי של BigScience, שעבר כוונון ייעודי להוראות ולשיחה על מאגרי נתונים כמו OIG, Dolly 2.0 ו־Oasst1. תהליך האימון בוצע על חומרת RDU של SambaNova ונועד להפוך את המודל הבסיסי לעוזר שיחה שמסוגל לענות על שאלות, לתרגם ולנהל דיאלוג מתמשך בכמה שפות, תוך שימוש בתבניות שיחה ברורות של אדם ובוט.

המשמעות של מהלך כזה היא ניסיון לקחת מודל שפותח במקור להשלמת טקסט כללית ולתת לו יכולת עבודה פרקטית מול משתמשים. המפתחים מציגים עדיפות במבחני העדפת אנושית ובתרגום לעומת מודלים פתוחים אחרים וגרסאות קודמות של המשפחה. יחד עם זאת, ההשוואות מראות פערים ברורים מול מודלים קנייניים מתקדמים כמו GPT-4, כך שהמטרה כאן היא בסיס חזק ורב לשוני בקוד פתוח ולא שבירת שיאי אינטליגנציה כלליים.

מתאים ל

  • עוזר שיחה רב לשוני

    אימון ייעודי על מאגרי שיחה מספק מענה שוטף ושאלות ותשובות במספר שפות.

  • תרגום טקסטים

    הארכיטקטורה המקורית של BLOOM נותנת יתרון במעבר שפות בהשוואה למודלי צ'אט פתוחים אחרים.

  • מחקר על מודלי ענק

    משקלים פתוחים של 176 מיליארד פרמטרים שמתאימים לבדיקת התנהגות מודלי ענק בסביבה סגורה.

איפה זה נופל

המודל מוגדר עדיין בשלבי פיתוח מוקדמים, והיוצרים שלו מזהירים מראש שהוא סובל מהזיות ופולט תשובות שגויות שנשמעות משכנעות. יש בעיה של מעבר לא רצוני בין שפות וניבים באמצע המשפט, ונטייה לחזרתיות על מילים וביטויים שפוגעת ברצף השיחה. הוא מתקשה באופן מובהק בכתיבת קוד ובמתמטיקה מורכבת, ועלול לייצר פלטים רעילים או לא הולמים. בשל כך נאסר עליו במפורש לשמש במערכות קריטיות, בקבלת החלטות מהותיות או בצנרות אוטומטיות ללא השגחה.

שאלות
נפוצות

האם אפשר להריץ את המודל על שרת עם שני כרטיסי GPU חזקים?

לא. משקל הקבצים לבדו הוא 335 גיגה בייט, ובדיקות המפתחים דרשו ארבעה כרטיסי A100 של 80GB וגם אז נתקלו במגבלות זיכרון. נדרשת חומרה ארגונית רחבה בהרבה רק כדי לטעון אותו לזיכרון.

האם המודל מתאים לייצור קוד או לפתרון בעיות מתמטיות?

הכרטיס מציין במפורש שהיכולות שלו בכתיבת קוד ובמתמטיקה מוגבלות מאוד. אם המטרה שלכם היא פיתוח תוכנה או חישובים, המודל הזה אינו הבחירה המתאימה.

איך מריצים

כדי להריץ מפלצת ששוקלת 335 גיגה בייט בקבצים תצטרכו חומרה כבדה מאוד. המפתחים עצמם מציינים שבבדיקות עם ארבעה כרטיסי A100 של 80GB הם נתקלו בבעיות זיכרון, ונאלצו להגביל את הזיכרון המוקצה לכל כרטיס בשימוש עם accelerate, או לעבור לחומרה הייעודית שלהם עם SambaFlow SDK.

יש אפשרות הרצה בפורמט bf16 שמציע את מלוא הביצועים, או מעבר לכיול ב־int8 שמקצר את זמני הריצה אבל מגיע עם אזהרה מפורשת על ירידה מורגשת באיכות הפלט. אם אין לכם אשכול שרתים ייעודי עם מאות גיגות של VRAM והתעסקות במבנה הזיכרון, פשוט אין הגיון לנסות להרים אותו מקומית ועדיף לפנות לפתרונות מנוהלים או ל־API חיצוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="sambanovasystems/BLOOMChat-176B-v1")
print(pipe("שלום"))

הרישיון

הרישיון מבוסס על Apache 2.0 שעבר התאמה עם מגבלות השימוש של רישיון ה־RAIL של מודל המקור. השימוש המסחרי והמחקרי מותר, ואין איסור גורף על הפצה או שינויים, אך חובה לעמוד בהגבלות השימוש הייעודיות.

הרישיון המלא בעמוד המודל ↗