GPT
B

bloom-7b1

קוד פתוח

bigsciencebigscience-bloom-rail-1.02022-05-19

  • transformers
  • pytorch
  • jax
  • safetensors
  • bloom

אימון פתוח של שבעה מיליארד פרמטרים שמכוון לריבוי שפות אמיתי ולא רק לאנגלית. מתאים למי שחוקר שפות מגוונות או מחפש בסיס פתוח שאינו תלוי בענקיות הטכנולוגיה.

  • 7.1Bפרמטרים
  • 39.5 GBמשקל הקבצים
  • 6,578הורדות בחודש
  • 202לייקים

מה זה

מדובר במודל שפה מבוסס מפענח בלבד עם 7.1 מיליארד פרמטרים, שנבנה על ארכיטקטורת Megatron-LM GPT2 עם התאמות מודרניות כמו קידודי מיקום ALiBI ונרמול שכבות מסוג StableEmbedding. הנתונים שלו כוללים 45 שפות טבעיות ושתים עשרה שפות תכנות על פני טרהבייט וחצי של טקסט, כשהמיקוד המרכזי הוא הכללה נרחבת של שפות מאפריקה ומהודו שלא מקבלות מענה ברוב המודלים המערביים.

במדדי ההערכה הרשמיים במהלך האימון הוא מציג Perplexity של 16, לצד Validation Loss של 2.9 ו־Training Loss של 2.3. המספרים האלה מעידים על למידה יציבה בהתחשב בהיקף השפות העצום, אך הביצועים שלו בשפות ספציפיות תלויים מאוד בנתח היחסי שהן קיבלו מתוך 350 מיליארד הטוקנים.

מתאים ל

  • מחקר בלשני רב-לשוני

    הוא כולל שפות נדירות מאפריקה ומהודו שלא קיימות כמעט באף מודל אחר בגודל הזה.

  • בסיס לכוונון עדין למשימות

    הארכיטקטורה שלו מתאימה להמשך אימון למשימות חילוץ מידע או מענה לשאלות לפי תחום.

  • יצירת קוד בסיסית

    הוא אומן על שתים עשרה שפות תכנות נפוצות כמו פייתון, ג'אווה ו־PHP.

איפה זה נופל

המודל פולט מידע שגוי שנראה אמין ומדויק לחלוטין, והכרטיס הרשמי מדגיש במפורש שאסור לסמוך עליו לצורך קבלת החלטות קריטיות, סיכומים עובדתיים או שימושים רפואיים, משפטיים ופיננסיים. יש לו נטייה לחזרתיות, הזיות, ושיקוף של הטיות וסטריאוטיפים שקיימים בטקסט הגולמי. בנוסף, חלון ההקשר שלו מוגבל ל־2048 טוקנים בלבד, מה שמקשה על עבודה עם מסמכים ארוכים.

שאלות
נפוצות

האם המודל הזה תומך בעברית בצורה טובה?

עברית אינה מופיעה ברשימת השפות המרכזיות שפורטו בכרטיס המודל. רוב המיקוד הוקצה לשפות הודו-אירופיות, שפות ניז'ר-קונגו, שפות מהודו ואנגלית, כך שלא כדאי לבנות עליו לעיבוד עברית איכותי.

האם כדאי להשתמש בו בתוך יישום רפואי או משפטי?

ממש לא. כרטיס המודל ותנאי הרישיון אוסרים במפורש על שילובו במערכות קריטיות כמו רפואה או משפט, היות שהוא נוטה לייצר מידע שגוי שמנוסח בצורה משכנעת.

איך מריצים

במשקל של כמעט ארבעים גיגה בייט בפורמט float16, אי אפשר להריץ אותו על כרטיס מסך ביתי סטנדרטי בלי קוונטיזציה. תצטרכו מעבד גרפי מקצועי עם לפחות 24 גיגה בייט זיכרון כדי לטעון אותו, או להשתמש בחלוקה לכמה כרטיסים באמצעות שילוב של Hugging Face transformers ו־DeepSpeed.

אם אתם צריכים רק בדיקות נקודתיות של יצירת טקסט ולא מתכננים אימון המשך ייעודי, עדיף להשתמש בנקודת קצה מנוהלת דרך ענן במקום להחזיק שרת יקר באוויר.

from transformers import pipeline

pipe = pipeline("text-generation", model="bigscience/bloom-7b1")
print(pipe("שלום"))

הרישיון

הרישיון הוא bigscience-bloom-rail-1.0. הוא מתיר שימוש מסחרי ומחקר, אבל מטיל מגבלות שימוש נוקשות לפי נספח A, כולל איסור מוחלט על שימוש רפואי, משפטי, מעקב, דירוג אשראי או יצירת תוכן מטעה ללא ייחוס.

הרישיון המלא בעמוד המודל ↗