GPT
F

falcon-40b-instruct

קוד פתוח

tiiuaeapache-2.02023-05-25

  • transformers
  • pytorch
  • falcon
  • text-generation
  • custom_code

גרסת שיחה מוכנה לעבודה שנשענת על אחד ממודלי הקוד הפתוח החזקים של 2023. אתם מקבלים מודל מלוטש באנגלית בלי צורך לאמן אותו בעצמכם.

  • 77.9 GBמשקל הקבצים
  • 4,266הורדות בחודש
  • 1,176לייקים
  • 60שכבות

מה זה

מדובר במודל שפה של 40 מיליארד פרמטרים שעבר כוונון עדין על 150 מיליון טוקנים ממאגר השיחות Baize יחד עם חמישה אחוזים ממאגר RefinedWeb. הוא נועד לענות לפקודות ולנהל שיחה ישירות מהקופסה, בניגוד למודל הבסיס שרק מנחש את הטוקן הבא ברצף.

הארכיטקטורה שלו מבוססת על GPT-3 אך כוללת שיפורים קריטיים להסקה מהירה, כמו מנגנוני FlashAttention ו־multiquery. לפי יוצריו, מודל הבסיס שלו עוקף בביצועיו מודלים כמו LLaMA, StableLM ו־MPT בלוח התוצאות של OpenLLM. התוצאה היא כלי חזק בהרבה ממודלי 7B טיפוסיים, שמציע הבנה עמוקה יותר ותשובות עקביות יותר.

מתאים ל

  • עוזר שיחה באנגלית

    מתאים לצ'אטבוטים ומענה לפקודות באנגלית בזכות אימון ייעודי על מאגר שיחות.

  • הפקה מהירה בתשתיות ענן

    מנצל מנגנוני FlashAttention לזמני תגובה קצרים בשרתים ייעודיים עם זיכרון גבוה.

  • שירות פנימי מאובטח

    הרישיון הפתוח מאפשר להריץ אותו מקומית לחלוטין בלי להוציא נתונים לשירותי צד שלישי.

איפה זה נופל

המודל אומן בעיקר על אנגלית וצרפתית, והיוצרים מציינים במפורש שהוא לא יעבוד כראוי בשפות אחרות. אם אתם בונים על עברית, זה לא יעבוד כאן בלי אימון משמעותי. חלון ההקשר שלו מוגבל ל־2048 טוקנים בלבד, שזה מעט מאוד לטקסטים ארוכים או לשיחות מתמשכות.

בנוסף, מאחר שהוא נשען על מידע שנאסף מהרשת, הוא סוחב איתו הטיות וסטריאוטיפים מקוונים. היוצרים מדגישים שאינו מתאים לייצור בלי בדיקות בטיחות ובניית מנגנוני הגנה סביבו, ואינו מתאים לכוונון עדין נוסף כי הוא כבר עבר התאמת שיחה.

אותה משפחה

falcon יצא ב־7 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב נייד או שולחני רגיל?

לא. המודל דורש בין 85 ל־100 גיגה-בייט של זיכרון כדי לפעול כראוי, והמשקל של הקבצים עצמם הוא 77.9 גיגה-בייט. תצטרכו שרת עם מספר מעבדים גרפיים חזקים כדי להעלות אותו.

האם הוא מתאים לשימוש בעברית?

הכרטיס מצהיר על תמיכה באנגלית ובצרפתית בלבד, ומזהיר שהמודל לא יעבוד טוב בשפות אחרות. טקסטים בעברית ייצרו פלטים שבורים ולא אמינים, ולכן לא מומלץ לבנות עליו לפרויקטים מקומיים.

איך מריצים

כדי להריץ אותו להסקה בצורה חלקה תצטרכו לפחות 85 עד 100 גיגה-בייט של זיכרון, מה שאומר מערך של כמה כרטיסי מסך חזקים או שרת ייעודי בענן. הטעינה שלו נעשית דרך ספריית transformers בפורמט bfloat16, כאשר הקבצים שוקלים 77.9 גיגה-בייט בסך הכול.

אם אין לכם תשתית כבדה כזו זמינה, יש גרסה קטנה בהרבה בשם Falcon-7B-Instruct. להרצה מהירה במיוחד בייצור היוצרים ממליצים להשתמש בכלי Text Generation Inference של Hugging Face, במקום סקריפט פייתון בסיסי.

from transformers import pipeline

pipe = pipeline("text-generation", model="tiiuae/falcon-40b-instruct")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו באופן חופשי לצרכים מסחריים, לשנות אותו, להריץ אותו בענן שלכם ולהטמיע אותו במוצרים, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗