GPT
F

falcon-40b-instruct-GPTQ

קוד פתוח

TheBlokeapache-2.02023-05-27

  • transformers
  • safetensors
  • RefinedWeb
  • text-generation
  • custom_code

גרסת 4 ביט ניסיונית למודל שיחה גדול, שמיועדת למי שחייב להריץ מודל של 40 מיליארד פרמטרים מקומית אבל מוגבל לכרטיס מסך בודד של 40GB.

  • 42Bפרמטרים
  • 21.0 GBמשקל הקבצים
  • 159הורדות בחודש
  • 197לייקים

מה זה

מדובר בכימות GPTQ של מודל ההוראות Falcon-40B, שעבר כוונון עדין על 150 מיליון טוקנים ממאגר Baize יחד עם חמישה אחוזים מנתוני RefinedWeb. הארכיטקטורה שלו כוללת 60 שכבות, FlashAttention ומנגנון multiquery, מה שאמור לייעל את החישוב ביחס למודלים ישנים יותר.

הגרסה הזו מכווצת את המודל המקורי מפורמט bfloat16 לגודל של 21 גיגה בייט בפורמט safetensors. TheBloke יצר אותה באמצעות AutoGPTQ ללא groupsize כדי לחסוך בזיכרון, אך עם act-order כדי לשמור על איכות הפלט. בניגוד לגרסת המקור, מטרת הכיווץ כאן היא רק היתכנות הרצה על חומרה צנועה יותר ולא שבירת שיאי מהירות.

מתאים ל

  • עיבוד אצווה באנגלית ללא ענן

    מתאים לניתוח טקסטים אוטומטי בלילה באנגלית, שבו מהירות של פחות מטוקן לשנייה אינה מהווה צוואר בקבוק.

  • בדיקות פיתוח מקומיות למודל 40B

    מאפשר לבחון התנהגות של מודל ענק על שרת פנימי עם כרטיס A100 יחיד, לפני שמתחייבים למשאבי מחשוב מלאים.

  • ניסויי התאמה אישית ב־AutoGPTQ

    משמש כבסיס לבדיקת תאימות של ספריות שונות עם מודלים מכומתים שעושים שימוש ב־act order ללא groupsize.

איפה זה נופל

החיסרון המרכזי הוא קצב ריצה זוחל שפוסל אותו משימוש בזמן אמת. בנוסף, נתוני האימון מבוססים על אנגלית וצרפתית בלבד, כך שאין מה לבנות עליו לעברית. אורך ההקשר מוגבל ל־2048 טוקנים, מעט מאוד למודלים בגודל כזה, ואימון ההוראות שלו מקורו בסינתזה שעלולה להכיל הטיות מהרשת.

אותה משפחה

falcon יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה על שני כרטיסי RTX 3090 או 4090?

הכרטיס הנוכחי מיועד להרצה על כרטיס בודד של 40GB או 48GB עם AutoGPTQ. פיצול על פני מספר כרטיסים צרכניים מסובך יותר לתמיכה בקונפיגורציה הניסיונית הזו, ולא נתמך ישירות בטעינה המתוארת בהנחיות.

מדוע המודל דורש הפעלת trust remote code בזמן הטעינה?

הארכיטקטורה של Falcon הייתה חדשה בזמן יציאת המודל ולא נתמכה ישירות בתוך קוד המקור של ספריית transformers. הדגל הזה מריץ שני קובצי פייתון שהועתקו ממאגר המקור כדי להגדיר את השכבות של הרשת על המחשב שלכם.

איך מריצים

כדי להעלות אותו תצטרכו לפחות 35GB של VRAM פנוי. בפועל זה אומר שאתם חייבים כרטיס מקצועי של 40GB או 48GB כמו A100 או A6000, ואין שום דרך לדחוף אותו לכרטיסי גיימינג סטנדרטיים של 24GB.

קצב הייצור עומד כרגע על כ־0.7 טוקנים לשנייה, שזה איטי מאוד ולא מתאים לממשק חי מול משתמש. נדרשת ספריית AutoGPTQ עם CUDA 11.7 או 11.8, או הידור עצמאי למי שעובד עם CUDA 12. המודל אינו נתמך ב־ExLlama או בגרסאות טריטון, ומחייב שימוש בדגל trust remote code בזמן הטעינה.

from transformers import pipeline

pipe = pipeline("text-generation", model="TheBloke/falcon-40b-instruct-GPTQ")
print(pipe("שלום"))

הרישיון

המטא־דאטה מציין רישיון Apache 2.0, אך כרטיס המודל המקורי מציין את רישיון TII Falcon. לפי תנאי TII, השימוש חופשי למחקר ולצרכים אישיים, אך שימוש מסחרי פטור מתמלוגים רק עד הכנסות של מיליון דולר בשנה. מעבר לכך נדרש הסכם מסחרי נפרד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗