GPT
F

falcon-40b

קוד פתוח

tiiuaeapache-2.02023-05-24

  • transformers
  • pytorch
  • safetensors
  • falcon
  • text-generation

בסיס קוד פתוח עם 40 מיליארד פרמטרים שמתאים למי שרוצה לאמן מודל משלו מאפס. הוא מציע ארכיטקטורה מהירה מאוד להסקה ורישיון חופשי לחלוטין לשימוש מסחרי.

  • 42Bפרמטרים
  • 156 GBמשקל הקבצים
  • 8,484הורדות בחודש
  • 2,439לייקים

מה זה

מדובר במודל שפה גולמי מסוג decoder-only שאומן על טריליון טוקנים, כאשר רוב המידע מגיע ממאגר RefinedWeb המסונן לצד קוד, ספרים ומאמרים טכניים. המטרה העיקרית שלו היא השלמת טקסט וחיזוי הטוקן הבא, והוא נבנה כנקודת מוצא להתאמה אישית ולא כמוצר שמוכן לשיחה עם משתמש קצה.

הייחוד שלו לעומת מודלים מקבילים מהתקופה שלו טמון בארכיטקטורה. שילבו בו FlashAttention ומנגנון multiquery מותאם שמאפשרים הסקה מהירה וחסכונית יותר במשאבים בזמן ריצה, לצד שכבות נורמליזציה כפולות ועיבוד מקבילי של תשומת הלב והשכבות הפנימיות. לפי יוצריו, בבדיקות של OpenLLM Leaderboard הוא עקף מודלים פתוחים אחרים כמו LLaMA ו־MPT.

מתאים ל

  • בסיס לאימון מודל ייעודי

    מתאים למי שרוצה לבצע finetuning על דאטה פנימי למשימות כמו סיכום או מיון באנגלית.

  • מחקר על מודלי שפה גדולים

    משמש לבדיקת ארכיטקטורות של multiquery וניתוח התנהגות מודלים בקנה מידה של 40B.

  • השלמת טקסט חופשי

    עובד כמנוע המשך טקסט או כתיבה יצירתית מונחית באנגלית ובשפות אירופאיות מרכזיות.

איפה זה נופל

זהו מודל גולמי שלא עבר כוונון להוראות או לצ'אט, ולכן אם תתנו לו פקודה פשוטה הוא כנראה ימשיך את המשפט במקום לענות. מעבר לזה, המודל אומן בעיקר על אנגלית, גרמנית, ספרדית וצרפתית, והמפתחים מציינים במפורש שהוא לא מכליל לשפות אחרות, כך שלעברית הוא לא מיועד בכלל ללא אימון נוסף. הוא גם סוחב איתו הטיות וסטריאוטיפים שמקורם באינטרנט, והמפתחים מתריעים שלא להשתמש בו בייצור בלי בדיקות סיכונים ומנגנוני הגנה.

אותה משפחה

falcon יצא ב־7 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו ישירות כצ'אטבוט?

לא. זהו מודל בסיס שמנבא את הטוקן הבא ולא יודע לנהל דיאלוג. אם אתם מחפשים מענה להוראות או שיחה, צריך להשתמש בגרסת Falcon-40B-Instruct או לאמן אותו בעצמכם על נתוני שיחה.

האם המודל תומך בעברית?

הכרטיס מציין תמיכה באנגלית, גרמנית, ספרדית וצרפתית, לצד יכולות מוגבלות בעוד כמה שפות אירופאיות. עברית לא נכללה בנתוני האימון והמודל לא יידע לעבוד איתה בצורה תקינה.

מה דרוש כדי לטעון אותו על שרת פרטי?

תצטרכו שרת עם לפחות 85 עד 100 גיגה בייט של VRAM כדי להריץ הסקה בסיסית, בגלל גודל המודל והמשקלים שנשמרים ב־bfloat16. בנוסף, חובה להתקין PyTorch 2.0 ומעלה כדי שספריית transformers תוכל להפעיל את הקוד שלו.

איך מריצים

כדי להריץ אותו להסקה צריך לפחות 85 עד 100 גיגה בייט של זיכרון GPU. הוא דורש PyTorch 2.0 ומעלה ועובד ישירות דרך ספריית transformers עם trust_remote_code מופעל, כאשר מומלץ להשתמש בכלי כמו Text Generation Inference כדי לקבל ביצועים סבירים.

מכיוון שמשקל הקבצים עומד על 156 גיגה בייט בפורמט bfloat16, תצטרכו שרת עם כמה כרטיסים חזקים רק כדי לטעון אותו. אם אין לכם תשתית כזו זמינה, הקמה ותחזוקה של מכונות ייעודיות רק עבורו תהיה יקרה בהרבה משימוש ב־API קיים, אלא אם יש לכם צורך מוחלט בפרטיות נתונים או התאמה פנימית עמוקה.

from transformers import pipeline

pipe = pipeline("text-generation", model="tiiuae/falcon-40b")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון Apache 2.0, שזה בדיוק מה שחברות רוצות לראות. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים סגורים ולהפיץ אותו הלאה, בלי לשלם תמלוגים ובלי מגבלות שימוש מיוחדות, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗