GPT
F

Falcon-H1R-7B-GGUF

קוד פתוח

tiiuaeother2025-11-28

  • transformers
  • gguf
  • falcon-h1r
  • text-generation
  • en

מודל הסקת מסקנות קומפקטי שמביא ארכיטקטורה היברידית של טרנספורמר עם Mamba2. הוא מתאים למי שרוצה ביצועים מתמטיים כבדים במכונה מקומית בלי לבלוע כמויות זיכרון של מודלי ענק.

  • 152 GBמשקל הקבצים
  • 4,919הורדות בחודש
  • 76לייקים

מה זה

מדובר במודל שבעה מיליארד פרמטרים מבית TII שמיועד מראש למשימות חשיבה מאומצות. הבסיס שלו משלב שכבות טרנספורמר רגילות עם Mamba2, שילוב שנועד לאפשר עיבוד שרשראות חשיבה ארוכות ביעילות גבוהה יותר בזמן ריצה. הוא עבר כוונון ייעודי עם מסלולי היקש ארוכים ואימון בחיזוקים בשיטת GRPO.

במבחני ביצועים התוצאות מראות דגש קיצוני על חישוב ולוגיקה קשיחה. במבחני AIME24 ו־AIME25 הוא מגיע ל־88.1 ו־83.1, ועוקף מודלים כמו Qwen3-8B ו־Phi-4-Reasoning-Plus-14B. בבדיקות הרחבת זמן חשיבה באמצעות DeepConf הציונים שלו במתמטיקה מזנקים ל־96.7. מנגד, במשימות תכנות כלליות כמו SciCode התוצאות צונחות ל־3.9 בלבד, מה שמבהיר שלא מדובר בכלי רחב לכל מטרה.

מתאים ל

  • פתרון בעיות מתמטיות

    משיג ציונים של 96.7 בבנצ'מרק AIME תחת הרחבת זמן חשיבה, תוצאה חריגה לגודל שלו.

  • בדיקת לוגיקה תיאורטית

    מתאים לניתוח הוכחות ואלגוריתמים מתמטיים שדורשים מעקב אחרי שרשרת היקש ארוכה ומפורטת.

  • שרת הסקות פנימי וסגור

    רץ מקומית דרך llama.cpp ומאפשר חשיבה מעמיקה בלי להוציא נתונים רגישים לענן חיצוני.

איפה זה נופל

החולשה המרכזית שלו היא משימות קוד מעשיות וסוכנים אוטונומיים. בבנצ'מרק Terminal-Bench Hard הוא מקבל 4.9 בלבד, וב־SciCode הציון הראשי עומד על 3.9, רחוק ממתחרים בגודל דומה. בנוסף, הכרטיס מציין צורך מפורש לכוונן פרמטרים נגד חזרתיות כדי למנוע ממנו להיכנס ללופים אינסופיים של פלט.

אותה משפחה

Falcon-H1R יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לפיתוח תוכנה וכתיבת קוד מלאה?

לא ממש. בעוד שבמבחן LCB הוא מגיע ל־68.6, בבדיקות עמוקות יותר כמו SciCode וסביבות טרמינל הציונים שלו נמוכים מאוד. עדיף להשתמש בו לחישובים ולוגיקה ולא כעוזר תכנות ראשי.

למה מוגדר לו גבול פלט של 65,536 טוקנים?

המודל אומן לייצר שלבי ביניים מפורטים מאוד לפני שהוא מגיע לתשובה הסופית. אם תגבילו אותו לכמות טוקנים קטנה, התשובה תיחתך באמצע תהליך ההיקש.

איך מריצים

המודל מחולק לקובצי GGUF ומיועד להרצה ישירה דרך llama-server של פרויקט llama.cpp. כדי להרים אותו צריך להדר את השרת, להגדיר טמפרטורה של 0.6, top-p של 0.95, ולהקצות טוקנים לפלט של עד 65,536, כי הוא נוטה לייצר שרשראות חשיבה ארוכות מאוד.

בגודל של שבעה מיליארד פרמטרים גרסת שמונה ביט נכנסת בקלות לכרטיס מסך ביתי בודד עם 12 עד 16 גיגה זיכרון. אם מטרת הפרויקט היא רק שאילתות פשוטות או שאין לכם צורך בחשיבה מתמטית עמוקה, פנייה ל־API גנרי ומהיר תחסוך את כאב הראש של ניהול שרתי llama.cpp.

ollama run hf.co/tiiuae/Falcon-H1R-7B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון מוגדר תחת Falcon-LLM License ולא כרישיון קוד פתוח סטנדרטי כמו אפאצ'י או MIT. הוא דורש קריאה והסכמה לתנאי השימוש הספציפיים של TII באתר שלהם, מה שאומר שלפני שילוב במוצר מסחרי צריך לבדוק את המגבלות והחובות המשפטיות שהם מגדירים שם.

הרישיון המלא בעמוד המודל ↗