GPT
G

granite-4.0-h-tiny-GGUF

קוד פתוח

unslothapache-2.02025-10-02

  • transformers
  • gguf
  • language
  • unsloth
  • granite-4.0

גרסת GGUF של יבמ למודל שבעה מיליארד פרמטרים שמתמחה בקריאות לפונקציות וקוד. מתאים למי שרוצה להריץ סוכן מקומי בלי לשלם על שירות ענן.

  • 109 GBמשקל הקבצים
  • 4,392הורדות בחודש
  • 37לייקים

מה זה

המודל הזה הוא גרסת הוראות בגודל 7B שפותחה על ידי יבמ ועברה קוונטיזציה של אנלוט. הוא משלב כוונון על בסיס נתונים פתוחים ומידע סינתטי פנימי, ומכוון ספציפית למשימות תאגידיות כמו חילוץ מידע, RAG ושיחה מובנית. הייחוד העיקרי שלו מול מודלים אחרים בסדר הגודל הזה הוא הדגש על חיבור לכלים חיצוניים בפורמט התואם לזה של OpenAI, יחד עם יכולת להשלמת קוד באמצע קובץ.

במבחני ביצועים הוא מציג תמונה מעניינת. במבחני קוד הוא מגיע ל־83 נקודות ב־HumanEval ו־80 ב־MBPP, שזה חזק לקטגוריה הזו, אבל במבחני היגיון עמוק ומדע כמו GPQA הוא נעצר ב־32.59 בלבד. במבחן הפעלת הכלים BFCL v3 הוא עומד על 57.65 נקודות. המשמעות ברורה, הוא יעיל במעקב אחרי הוראות מוגדרות וכתיבת פונקציות, אך מוגבל מאוד בהסקת מסקנות מורכבת.

מתאים ל

  • סוכן מקומי לקריאת כלים

    הוא תומך ישירות בסכמת הפונקציות של OpenAI ומאפשר הפעלת API פנימי בלי להוציא נתונים החוצה.

  • השלמת קוד באמצע קובץ

    הוא מאומן מראש על משימות FIM, מה שהופך אותו לרלוונטי עבור תוספי עריכת קוד מקומיים.

  • חילוץ נתונים משפות נתמכות

    הוא מיועד למבנה שיחה קשיח ויודע לשלוף מידע מובנה באנגלית ובשפות אירופיות נוספות.

איפה זה נופל

החולשה המרכזית שלו היא היעדר תמיכה בעברית. רשימת השפות הרשמית כוללת שתים עשרה שפות, בהן אנגלית, ערבית, גרמנית וספרדית, אבל עברית אינה מופיעה בהן. אם תנסו לעבוד איתו בעברית תקבלו תוצאות שבורות או שגיאות תחביר.

בנוסף, מבחני הבטיחות שלו מראים אמנם ציונים גבוהים, אך ב־CRUXEval-O הוא משיג רק 39.63 וב־BigCodeBench הוא על 41.06, כך שאי אפשר לסמוך עליו בעיניים עצומות בהרצת קוד מורכב בלי בדיקה אנושית.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה עבור מערכת בעברית?

לא. עברית אינה חלק מרשימת השפות הנתמכות שפרסמה יבמ, והוא לא יספק תוצאות אמינות ללא כוונון ייעודי נוסף.

כמה מתוך 109 הגיגה בייט שבמאגר צריך להוריד בפועל?

מורידים קובץ אחד בלבד. המאגר מכיל גרסאות קוונטיזציה שונות, ומשקלו של קובץ עבודה טיפוסי נע סביב ארבעה עד שמונה גיגה בייט.

איך מריצים

המאגר כולל 32 קבצים במשקל כולל של 109 גיגה בייט, שמכילים רמות דיוק שונות בפורמט GGUF. אתם לא מורידים את הכל, אלא בוחרים קובץ בודד לפי כמות הזיכרון שיש לכם בכרטיס המסך או במעבד. מודל של שבעה מיליארד פרמטרים בקוונטיזציה סטנדרטית ירוץ בלי בעיה על מחשב מקומי עם שמונה עד שישה עשר גיגה בייט של זיכרון עבודה.

אם כל מה שאתם צריכים זה ניתוח טקסט חד פעמי או שאין לכם חומרה ייעודית, עדיף להשתמש במודל גדול יותר דרך ממשק תוכנה חיצוני. הרצה מקומית משתלמת רק אם יש דרישה לפרטיות, אם המידע לא יכול לצאת מהרשת, או כשבונים מערכת פנימית עם קריאות מרובות לפונקציות מקומיות.

ollama run hf.co/unsloth/granite-4.0-h-tiny-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל משוחרר תחת רישיון אפאצ'י 2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של המשקלים, הפצה ושילוב במוצרים סגורים. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי, בלי להטיל אחריות משפטית על המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗