GPT
F

Falcon-H1R-7B

קוד פתוח

tiiuaeother2025-10-29

  • transformers
  • safetensors
  • falcon_h1
  • text-generation
  • falcon-h1r

ארכיטקטורה היברידית של טרנספורמר עם מאמבה 2 שמתמקדת בהסקה לוגית ארוכה. מתאים למי שרוצה ביצועים מתמטיים של מודלים ענקיים אבל בתוך חומרה צנועה של שבעה מיליארד פרמטרים.

  • 7.6Bפרמטרים
  • 262,144טוקנים בהקשר
  • 14.1 GBמשקל הקבצים
  • 2,407הורדות בחודש

מה זה

מדובר במודל הסקה שנבנה על בסיס Falcon-H1-7B ועבר אימון ייעודי עם מסלולי חשיבה ארוכים וחיזוק באמצעות GRPO. המבנה שלו משלב שכבות טרנספורמר עם Mamba2, מה שמיועד להתמודד ביעילות עם שרשראות חשיבה כבדות בלי לפוצץ את צריכת הזיכרון.

במבחני מתמטיקה הוא מציג מספרים יוצאי דופן לגודלו. במבחן AIME24 הוא הגיע לציון 88.1, ובשקלול הרחבת זמן ריצה הגיע ל־96.7, תוצאות שעוקפות מודלים גדולים ממנו כמו Qwen3 של 32 מיליארד פרמטרים. בקוד הוא משיג 68.6 במבחן LCBv5-v6, מה שמציב אותו בעמדה חזקה לתכנות אבל עדיין מעט מתחת למודלים ייעודיים כמו GPT-OSS-20B.

מתאים ל

  • פתרון בעיות מתמטיות קשות

    משיג דיוק של 88.1 ב־AIME24 בזכות תהליך אימון ממוקד בחשיבה ארוכה.

  • ניתוח לוגי וכתיבת קוד

    מציג 68.6 במבחן LCBv5-v6 ומספק תהליך הסקה מפורט לפני כתיבת הפתרון.

  • מערכות מבוססות חומרה קלה

    ארכיטקטורת Mamba2 מאפשרת יעילות חישובית על כרטיס גרפי יחיד של 24GB.

איפה זה נופל

במשימות של סוכנים אוטומטיים ועבודה מול טרמינל הוא מתקשה מאוד. במבחן Terminal-Bench Hard הוא קיבל 4.9 בלבד, ובמבחן תקשורת לסוכנים הגיע ל־25.4, הרבה מאחורי מתחרים בגודל בינוני. בנוסף, המודל נוטה לייצר פלטים ארוכים ביותר של חשיבה בתגיות ייעודיות, והמפתחים מציינים במפורש שצריך להגדיר מקדמי ענישה על חזרתיות כדי למנוע ממנו להיתקע בלולאות אינסופיות. מבחינת שפות, המודל אומן בעיקר באנגלית, כך שאין לצפות לביצועי הסקה אמינים בעברית.

אותה משפחה

Falcon-H1R יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל עובד בעברית?

הכרטיס מציין אנגלית ויכולות רב־לשוניות כלליות, אך לא מפרט תמיכה רשמית בעברית. היות ומדובר במודל הסקה שנשען על שרשראות חשיבה מורכבות, שאילתות בעברית עלולות להניב פגיעה חדה ברמת ההיגיון והקוד. מומלץ להריץ משימות הסקה באנגלית בלבד.

איך מחלצים את התשובה הסופית מתוך ההסקה?

המודל עוטף את שלבי החשיבה בתוך תגיות של think ולאחריהן מציג את הפתרון. בשימוש דרך שרתי vLLM או SGLang, ניתן להפעיל את הדגל reasoning-parser עם הערך deepseek_r1 כדי לפצל את ההסקה מהתוכן הסופי באופן אוטומטי.

למה המודל חוזר על אותם משפטים שוב ושוב?

בשל האימון על מסלולי חשיבה ארוכים, המודל עלול להיכנס ללולאות טקסט אינסופיות. כדי לתקן את זה, יש להגדיר repetition_penalty או presence_penalty בהגדרות הדגימה, ולשמור על ערכי temperature סביב 0.6 ו־top-p סביב 0.95 כפי שהיוצרים ממליצים.

איך מריצים

המשקל עומד על 14.1 גיגה בייט בפורמט bfloat16, כך שכרטיס מסך בודד עם 24 גיגה זיכרון יספיק לטעינה פשוטה. אפשר להריץ אותו דרך vLLM, SGLang או ישירות מספריית transformers עם התקנת החבילה הייעודית mamba-ssm causal-conv1d.

חלון ההקשר המלא מגיע ל־262,144 טוקנים ותומך בפלט של עד 65,536 טוקנים למסלול חשיבה. בהרצה מקומית כדאי להגביל את max-model-len אם חסר זיכרון, וליוצרי שירותים עם תעבורה רציפה מומלץ לחלק את העומס על שני כרטיסים באמצעות TP=2. אם אין לכם חומרה ייעודית עם רוחב פס גבוה, תהליכי הסקה ארוכים כאלה יזחלו, ושם עדיף לשקול שרת מנוהל.

from transformers import pipeline

pipe = pipeline("text-generation", model="tiiuae/Falcon-H1R-7B")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר תחת Falcon-LLM License ולא כרישיון קוד פתוח סטנדרטי כמו אפאצ'י או MIT. הוא מאפשר שימוש מסחרי, אך כולל תנאים והגבלות ספציפיים שהארגון קבע באתר הרשמי שלו. אם אתם מתכננים לשלב אותו במוצר מסחרי, חובה לקרוא את נוסח הרישיון המלא ולוודא שהשימוש שלכם אינו חורג מההגבלות המשפטיות שהוגדרו בו.

הרישיון המלא בעמוד המודל ↗