GPT
F

Falcon-H1-1.5B-Deep-Instruct

קוד פתוח

tiiuaeother2025-05-01

  • transformers
  • safetensors
  • falcon_h1
  • text-generation
  • falcon-h1

מודל קומפקטי של 1.6 מיליארד פרמטרים שמשלב טרנספורמר עם Mamba, ומביא יכולות חשיבה וקוד חריגות לגודל שלו. הוא מתאים למי שרוצה ביצועים גבוהים מקומית בלי לתפוס כרטיס מסך כבד.

  • 1.6Bפרמטרים
  • 131,072טוקנים בהקשר
  • 2.9 GBמשקל הקבצים
  • 10,527הורדות בחודש

מה זה

המודל הזה משתמש בארכיטקטורה היברידית של טרנספורמר ומנגנון Mamba, עם 66 שכבות וחלון הקשר גדול במיוחד של 131,072 טוקנים. השילוב הזה נועד לאפשר טיפול בהקשר ארוך בלי צוואר הבקבוק החישובי שמאפיין מודלים רגילים. הוא מאומן למעקב אחר הוראות באנגלית ורב־לשוני, ומגיע במשקל קבצים צנוע של 2.9 גיגה־בייט בדיוק bfloat16.

במבחני ביצועים מול מתחרים באותו סדר גודל כמו Qwen ו־Llama, הוא מציג יתרון בולט בתחומי החשיבה, המתמטיקה והתכנות. במבחן GSM8k הוא מגיע ל־82.34 לעומת 69.83 של Qwen3-1.7B, וב־HumanEval הוא רושם 73.78 מול 67.68. המשמעות בפועל היא יכולת טובה משמעותית לפתור תרגילים מורכבים ולכתוב קוד מדויק ברמת משקל כזו, אם כי במבחן LiveBench המקיף הוא מגיע ל־36.83 ומפגר אחרי Qwen3 שמשיג 40.73.

מתאים ל

  • השלמת קוד מקומית

    הוא משיג 73.78 ב־HumanEval, תוצאה חזקה למודל קטן שיכול לרוץ ברקע על מחשב פיתוח ללא ענן.

  • עיבוד מסמכים ארוכים

    חלון הקשר של 131,072 טוקנים מאפשר להזין תיעוד טכני שלם לניתוח מהיר ישירות בזיכרון של שרת צנוע.

  • פתרון בעיות מתמטיות

    עם ציון של 82.34 ב־GSM8k, הוא מתאים לשילוב כשלב חשיבה וחישוב באוטומציות ללא צורך במודל ענק.

איפה זה נופל

למרות ההבטחה לתמיכה רב־לשונית, המודל מתמקד באנגלית ואין בכרטיס שום פירוט על איכות העברית שלו, מה שמחייב בדיקה מעשית לפני כל שילוב במערכת מקומית. כמו כן, מודל של 1.6 מיליארד פרמטרים עדיין מוגבל בידע כללי, ובמבחן LiveBench הוא מפסיד למתחרים בגודל דומה. הוא עלול לטעות בעובדות מורכבות, וארכיטקטורת Mamba היברידית דורשת ספריות עדכניות כדי שלא להיתקל בבעיות תאימות בהרצה.

שאלות
נפוצות

האם המודל תומך בעברית כמו שצריך?

הכרטיס מציין תמיכה רב־לשונית כללית לצד אנגלית, אך ללא נתונים על שפות ספציפיות. מודלים בגודל 1.6B בדרך כלל מתקשים ביצירת טקסט עברי שוטף בלי אימון ייעודי, ולכן מומלץ לבדוק אותו על מדגם משימות בעברית לפני שמסתמכים עליו.

מה המשמעות של ארכיטקטורת Hybrid Transformers ו־Mamba?

במקום להסתמך רק על מנגנון הקשב הרגיל של טרנספורמר, המודל משלב שכבות Mamba שמנהלות זיכרון בצורה יעילה יותר. זה מאפשר לו להתמודד עם הקשר ארוך של 131,072 טוקנים במהירות גבוהה ובפחות משאבי זיכרון.

איך מריצים

המשקל של הקבצים עומד על 2.9 גיגה־בייט בלבד, מה שאומר שאפשר להריץ אותו בקלות על מעבד גרפי בסיסי מאוד, כולל כרטיסים ביתיים עם 6 עד 8 גיגה זיכרון, או ישירות על לפטופים באמצעות llama.cpp וגרסאות GGUF. התמיכה זמינה כבר ב־transformers, ב־vLLM מגרסה 0.9.0 ומעלה עם פקודת serve פשוטה, וב־llama.cpp.

היתרון בהרצה עצמית כאן הוא עלות אפסית ופרטיות מלאה למשימות קוד או ניתוח טקסטים. אם צריך רק תשובות מזדמנות או משימות שדורשות הבנת עולם רחבה בהרבה שלא נכנסת במודל קטן, פנייה ל־API של מודל ענק מסחרי תהיה פשוטה וטובה יותר.

from transformers import pipeline

pipe = pipeline("text-generation", model="tiiuae/Falcon-H1-1.5B-Deep-Instruct")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־Falcon-LLM License ולא כרישיון קוד פתוח סטנדרטי כמו MIT או Apache. תנאי השימוש המסחריים שלו דורשים בדיקה מדויקת מול נוסח הרישיון של המכון באבו דאבי לפני הפצה במוצר.

הרישיון המלא בעמוד המודל ↗