GPT
F

Falcon-H1-Tiny-90M-Instruct

קוד פתוח

tiiuaeother2026-01-12

  • transformers
  • safetensors
  • falcon_h1
  • text-generation
  • falcon-h1

הוא שוקל 176 מגה בייט בלבד, אבל מגיע עם חלון הקשר של 262 אלף טוקנים. פתרון ממוקד למי שחייב להריץ מודל הוראות על מכשיר קצה חלש או בסביבת זיכרון הדוקה.

  • 91Mפרמטרים
  • 262,144טוקנים בהקשר
  • 176 MBמשקל הקבצים
  • 1,598הורדות בחודש

מה זה

בגודל של 91 מיליון פרמטרים, המודל הזה מתברג בקטגוריה של מודלים זעירים במיוחד, אבל הארכיטקטורה שלו חריגה בנוף. במקום להסתמך רק על מנגנון תשומת לב רגיל, TII שילבו כאן ארכיטקטורה היברידית של Transformers ו־Mamba על פני 24 שכבות. השילוב הזה מאפשר לו לתמוך בחלון הקשר ענק של 262,144 טוקנים בלי לקרוס תחת דרישות זיכרון מופרכות, משהו שבדרך כלל שמור למודלים כבדים בהרבה.

הוא מיועד להבנת הוראות באנגלית ומגיע מוכן לשימוש מהקופסה. הנתונים מראים קובץ קל מאוד שמתאים למשימות ממוקדות של הפקת טקסט, אבל צריך לזכור שעם 91 מיליון פרמטרים אי אפשר לצפות ליכולות ידע כללי או הסקת מסקנות מורכבת שרואים במודלים של מיליארדי פרמטרים. המטרה פה היא מהירות ויעילות על הקצה, לא פילוסופיה.

מתאים ל

  • עיבוד טקסט במכשירי קצה

    הוא שוקל 176 מגה בייט בלבד ורץ ישירות על מעבדים פשוטים בלי חיבור לאינטרנט ובלי כרטיס מסך.

  • סיווג ומיון הוראות באנגלית

    הארכיטקטורה המעורבת עם מאמבה מתאימה למשימות קצרות וממוקדות הדורשות תגובה מהירה מאוד.

  • שרתים מקומיים דלי משאבים

    תמיכה מובנית ב־ollama וב־vLLM מאפשרת להרים אותו כרכיב רקע קל שלא תופס זיכרון עבודה יקר.

איפה זה נופל

הגודל הזעיר הוא גם המגבלה המרכזית. עם 91 מיליון פרמטרים, כושר ההבנה והדיוק מוגבלים מאוד בהשוואה לכל מודל סטנדרטי. המודל אומן על אנגלית בלבד, כך שעבור עברית אין מה לבנות עליו לפלט קוהרנטי. בנוסף, חלון הקשר של 262 אלף טוקנים עלול להטעות. הוא מסוגל לקבל את הקלט הזה טכנית, אבל מודל זעיר כזה יתקשה לשלוף מידע מדויק או לשמור על עקביות לאורך טקסטים ארוכים באמת.

שאלות
נפוצות

האם המודל הזה מתאים לעבודה בעברית?

לא. כרטיס המודל מציין תמיכה באנגלית בלבד. בנפח של 91 מיליון פרמטרים אין לו שום סיכוי להפיק עברית שמישה.

איך ייתכן חלון הקשר של 262 אלף טוקנים על מודל כזה קטן?

השילוב של שכבות Mamba לצד הטרנספורמר מאפשר לנהל את הזיכרון ביעילות גבוהה בלי התנפחות המשאבים הרגילה. עם זאת, היכולת של מודל זעיר לעבד עומק כזה בפועל צנועה למדי.

איך מריצים

אין שום צורך בחומרת שרתים כבדה או בכרטיסי מסך ייעודיים יקרים. עם משקל של 176 מגה בייט, המודל הזה רץ בנוחות על כל מעבד מודרני, טלפון, או מחשב מק באמצעות ספריית mlx, וגם דרך ollama ו־llama.cpp עם קובצי GGUF בקוונטיזציה של Q8_0. אם אתם בונים שרת מקומי מהיר, הוא נתמך ישירות ב־vLLM, ב־sglang וגם ב־transformers הרגיל.

בגודל כזה ממש אין היגיון לשלם לספקי ענן על קריאות API למודלים חיצוניים, אלא אם אתם צריכים איכות פלט ברמה של מודלי ענק. כל מחשב פיתוח רגיל מריץ אותו מקומית ובחינם בלי להרגיש עומס על הזיכרון.

from transformers import pipeline

pipe = pipeline("text-generation", model="tiiuae/Falcon-H1-Tiny-90M-Instruct")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־Falcon-LLM License ולא כרישיון קוד פתוח סטנדרטי כמו Apache או MIT. זה אומר שיש תנאים ייעודיים של היוצרים שצריך לקרוא לפני שמטמיעים אותו במוצר מסחרי, ולא בטוח שכל שימוש חופשי לחלוטין ללא הגבלות.

הרישיון המלא בעמוד המודל ↗