GPT
B

bloom-560m

קוד פתוח

bigsciencebigscience-bloom-rail-1.02022-05-19

  • transformers
  • pytorch
  • jax
  • onnx
  • safetensors

גרסה קלה של מודל שפות מרובה, שמתאימה למי שרוצה לבדוק התנהגות של מודלי שפה על חומרה מקומית רגילה בלי משאבים כבדים.

  • 559Mפרמטרים
  • 12.3 GBמשקל הקבצים
  • 450,283הורדות בחודש
  • 375לייקים

מה זה

הארכיטקטורה מבוססת על מפענח בלבד שפותח מ־Megatron-LM GPT2, עם שינויים כמו קידודי מיקום ALiBI ונרמול שכבות בכניסת ה־embeddings. הוא מכיל 559,214,592 פרמטרים, כאשר קרוב למחצית מהם, 256,901,120 פרמטרים, שייכים לשכבת ה־embeddings בגלל מילון ענק של 250,680 טוקנים.

באימון הוא נחשף ל־45 שפות טבעיות ול־12 שפות תכנות שונות, מבוסס על 1.5 טרה־בייט טקסט. התוצאות מראות loss אימון של 2.0, loss ולידציה של 2.2 וערך perplexity של 8.9, מה שמעיד על התכנסות סבירה של המודל על הדאטה, אבל בגודל כזה היכולות מוגבלות בעיקר להשלמת טקסט ולא לפתרון משימות מורכבות.

מתאים ל

  • מחקר בלשני על מודלי שפה

    מאפשר לבדוק תופעות כמו מבחני cloze והטיות על פני עשרות שפות שונות בחומרה פשוטה.

  • אימון ייעודי למשימות חילוץ

    משמש כבסיס קל משקל ל־fine-tuning על משימות כמו חילוץ מידע מובנה או סיווג.

  • ניתוח תחביר בקוד תוכנה

    נחשף ל־12 שפות פיתוח ומסוגל להשלים קטעי קוד פשוטים בשפות כמו Java, פייתון ו־C++.

איפה זה נופל

היוצרים מבהירים שהמודל פולט תוכן שנראה עובדתי אך שגוי לחלוטין. הוא נוטה לחזרתיות, טעויות קשות, פליטת סטריאוטיפים וטקסט פוגעני, ואסור להשתמש בו לקבלת החלטות מהותיות, לחיזוי רפואי, משפטי או פיננסי. מעבר לזה, חלון ההקשר שלו מוגבל ל־2048 טוקנים, ובגודל של חצי מיליארד פרמטרים יכולת ההבנה של שפות עם ייצוג נמוך חלשה מאוד.

אותה משפחה

bloom יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לעברית?

המודל לא אומן על עברית, שכן רשימת השפות כוללת בעיקר אנגלית, ערבית, שפות הודיות ושפות מניז'ר-קונגו. הוא ייכשל בייצור או הבנה של טקסט עברי תקני. אם המטרה היא עבודה בעברית, צריך לבחור מודל אחר.

האם הוא מתאים לייצור בוט שירות ללקוחות?

לא, המפתחים מגדירים שימוש לקבלת החלטות אוטומטיות כשימוש מחוץ לטווח המותר. המודל מייצר מידע שגוי כעובדה ונוטה לחזרות ופליטת שגיאות. הוא לא בנוי לתת תשובות עובדתיות אמינות ללקוחות.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון. מודל עם 559 מיליון פרמטרים תופס מעט מאוד זיכרון, כך שכרטיס מסך בסיסי או אפילו מעבד רגיל יספיקו כדי להריץ עליו inference.

הוא שוקל 12.3 גיגה־בייט ב־21 קבצים ברשת, אך בזמן ריצה צריכת ה־VRAM נמוכה בהרבה. אין צורך לשלם על API חיצוני בשביל גודל כזה, כי העלות החישובית של הרצה מקומית כמעט אפסית.

from transformers import pipeline

pipe = pipeline("text-generation", model="bigscience/bloom-560m")
print(pipe("שלום"))

הרישיון

רישיון bigscience-bloom-rail-1.0 מתיר שימוש ומחקר, כולל בנגזרות של המודל, אך מחייב עמידה במגבלות שימוש נוקשות. אסור להפעיל אותו בתחומים בעלי סיכון גבוה כמו החלטות משפטיות, רפואה, דירוג אנשים, מעקב לא מורשה או הפצת ספאם, ויש חובת ייחוס של התוכן למודל.

הרישיון המלא בעמוד המודל ↗