GPT
F

Falcon-H1-34B-Instruct

קוד פתוח

tiiuaeother2025-05-01

  • transformers
  • safetensors
  • falcon_h1
  • text-generation
  • falcon-h1

שילוב היברידי של טרנספורמר וארכיטקטורת Mamba עם חלון של 262,144 טוקנים. הוא פונה למי שצריך מודל הוראות בקנה מידה של 34 מיליארד פרמטרים ומחפש אלטרנטיבה למבנה המקובל.

  • 34Bפרמטרים
  • 262,144טוקנים בהקשר
  • 62.7 GBמשקל הקבצים
  • 1,550הורדות בחודש

מה זה

הארכיטקטורה הפנימית נשענת על מודל היברידי של Transformers יחד עם Mamba, מה שאמור לסייע בעיבוד יעיל של רצפים ארוכים. המודל מגיע בגרסת Instruct ומכוון למשימות שיחה, קוד והיסק, לצד תמיכה בשפות כמו ערבית, אנגלית, גרמנית, צרפתית, ספרדית, הינדי, צ'כית ואיטלקית.

במבחני ביצועים הוא מציג תמונה מעורבת ביחס למתחרים סביב 32 עד 70 מיליארד פרמטרים. במדעי הטבע הוא מוביל במבחנים כמו GPQA עם ציון 41.53 ו־MMLU-Pro עם 58.73, אך במתמטיקה הוא מפגר אחרי מתחרים כמו Gemma3-27B ו־Llama3.3-70B שהגיעו ליותר מ־90 נקודות ב־GSM8k, בעוד הוא נעצר על 83.62. בעבודה מול קוד הוא משיג 87.2 ב־HumanEval, תוצאה טובה אך לא המובילה בקטגוריה.

מתאים ל

  • ניתוח מסמכי מדע ומחקר

    הוא השיג 41.53 ב־GPQA ו־58.73 ב־MMLU-Pro, ציונים גבוהים מרוב הדגמים המקבילים בקטגוריה.

  • עיבוד טקסטים ארוכים

    חלון הקשר של 262,144 טוקנים יחד עם ארכיטקטורת Mamba מיועדים להתמודד עם כרכי מידע גדולים.

  • סיוע בכתיבת קוד

    עם ציון של 87.2 ב־HumanEval ותמיכה ב־vLLM, הוא יכול לתפקד כמנוע השלמות ופיתוח פנימי בארגון.

איפה זה נופל

עברית בכלל לא מופיעה ברשימת השפות הנתמכות, כך שכל ניסיון להשתמש בו לטקסט מקומי ידרוש בדיקה יסודית ולא מובטח שיעבוד באופן סביר. בנוסף, במבחני עקיבה אחר הוראות מורכבות יש פערים בולטים. במדד LiveBench הוא השיג 46.26 בלבד, לעומת מעל 63 אצל Qwen3-32B, וב־Alpaca-Eval קיבל 48.32, מה שמעיד על נטייה לפספס הנחיות מסובכות ביחס לחלק מהמתחרים.

שאלות
נפוצות

האם המודל מתאים לשימוש בעברית?

השפות המוצהרות כוללות אנגלית, ערבית, גרמנית, צרפתית, ספרדית, הינדי, צ'כית ואיטלקית בלבד. עברית אינה ברשימה הרשמית, ולכן סביר להניח שהיכולות שלו בה מוגבלות מאוד ויידרש אימון נוסף כדי להשתמש בו בארץ.

איך הכי קל להרים שרת מקומי שלו?

הדרך הנוחה ביותר לפריסה מהירה היא שימוש ב־vLLM מגרסה 0.9.0 ומעלה, עם חלוקה על פני מספר כרטיסים באמצעות tensor parallel. למי שמחפש הרצה מקומית על מחשב אישי, קיימים קובצי GGUF רשמיים שמתאימים ל־llama.cpp.

איך מריצים

כדי להריץ 34 מיליארד פרמטרים בפורמט המקורי של bfloat16 צריך חומרת שרתים רצינית. משקל הקבצים לבדו עומד על 62.7 ג'יגה בייט על פני 23 קבצים נפרדים, מה שאומר שכרטיס בודד של 24 ג'יגה בייט לא יספיק לטעינה בלי קוונטיזציה. בשרת עצמאי תצטרכו לפחות שני מאיצים של 48 או 80 ג'יגה בייט כדי לשרת בקשות ולקבל מקום לזיכרון ההקשר.

מבחינת ספריות, יש תמיכה ישירה ב־transformers, ב־vLLM החל מגרסה 0.9.0 שמאפשרת להרים שרת עם חלוקה בין מעבדים גרפיים, וב־llama.cpp דרך קובצי GGUF רשמיים. מי שאין לו תשתית כזו במשרד יעדיף לקחת שרת ענן ייעודי לפי שעה, כי מודלים היברידיים דורשים תוכנה עדכנית ולעיתים התקנה ישירות מקוד המקור כדי לתמוך בשכבות ה־Mamba.

from transformers import pipeline

pipe = pipeline("text-generation", model="tiiuae/Falcon-H1-34B-Instruct")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון ייעודי שמוגדר כ־Falcon-LLM License ולא תחת רישיון קוד פתוח סטנדרטי דוגמת Apache או MIT. המשמעות היא שחובה לקרוא את נוסח הרישיון המלא של TII לפני שילוב שלו במוצר מסחרי, כדי לוודא שאין בו הגבלות שימוש, דרישות תמלוגים או התניות לגבי הפצת הנגזרות.

הרישיון המלא בעמוד המודל ↗