GPT
G

gemma-4-E2B-it-qat-GGUF

קוד פתוח

unslothapache-2.02026-06-05

  • transformers
  • gguf
  • gemma4
  • image-text-to-text
  • unsloth

גרסת GGUF שעברה כיול קוונטיזציה עבור מודל מולטימודלי קל במיוחד. מיועדת למי שרוצה לעבד טקסט, תמונה ואודיו ישירות על חומרה מקומית או מכשירי קצה.

  • 131,072טוקנים בהקשר
  • 8.6 GBמשקל הקבצים
  • 580,583הורדות בחודש
  • 74לייקים

מה זה

הבסיס כאן הוא מודל עם 2.3 מיליארד פרמטרים אפקטיביים ו־5.1 מיליארד יחד עם שכבות השיבוץ, שעושה שימוש בטבלאות שיבוץ ייעודיות לכל שכבה כדי לשמור על יעילות חישובית. המרת המשקלים של אנלות' משתמשת באימון מודע קוונטיזציה (QAT) כדי לכווץ את הזיכרון בלי לשלם את המחיר הרגיל באיכות הפלט ביחס לדיוק המקורי. בנוסף לטקסט, המבנה כולל מקודדי ראייה ושמע נפרדים ומקבל שאלות על תמונות, קטעי וידאו כפריימים והקלטות קול עד שלושים שניות.

במבחני ביצועים, ההקרבה על גודל קומפקטי בולטת מאוד. הוא מקבל 60.0% ב־MMLU Pro וציון של 44.0% ב־LiveCodeBench v6, מול מעל שבעים ושמונים אחוז באחיו הגדולים. גם בבדיקות תכנות כמו Codeforces הוא עומד על ELO של 633 בלבד. זה כלי שנועד להבנת שפה פשוטה ועיבוד קלט מעורב על מכשירים חלשים, לא לפתרון חידות היגיון קשות או כתיבת אלגוריתמים מורכבים.

מתאים ל

  • תמלול פקודות קוליות

    מקבל ישירות קטעי אודיו קצרים עד שלושים שניות ומפיק תמלול מדויק בלי צורך במודל דיבור נפרד.

  • זיהוי תמונות במכשיר קצה

    מתאים לסריקת ממשקים, פענוח שלטים או חילוץ טקסט מתמונה במחשב נייד ללא חיבור לשרת.

  • סוכן מקומי קל משקל

    תומך בקריאות לפונקציות ובמשתמש מערכת, ומאפשר אוטומציות פשוטות ישירות מתוך זיכרון העבודה המקומי.

איפה זה נופל

גודל המודל גובה מחיר כבד באמינות שלו. במבחני שליית מידע מתוך הקשר רחב כמו MRCR v2 של 128 אלף טוקנים הוא מגיע לדיוק של 19.1% בלבד, מה שאומר שהוא מתקשה לשלוף עובדות מקבצים ארוכים למרות שהארכיטקטורה תומכת בחלון גדול. שמע מוגבל לחצי דקה, וידאו מוגבל לדקה אחת בלבד, וצריך להקפיד על סדר הקלט בפרומפט: קודם תמונה, אחר כך טקסט, ורק אז שמע.

שאלות
נפוצות

האם המודל חושב לפני שהוא עונה?

כן, יש לו מנגנון חשיבה מובנה שמופעל באמצעות הטוקן המיועד בתוך פרומפט המערכת. בגרסאות הקטנות כמו זו, אם מכבים את מנגנון החשיבה הוא מדלג על תגיות המחשבה ועונה ישירות בלי לפלוט בלוק ריק.

כמה משאבים לוקח מודל הטיוטה שמגיע איתו?

מודל ה־MTP חולק את אותו מטמון מפתחות וערכים של מודל המטרה, כך שהוא כמעט לא גוזל זיכרון נוסף. הוא פשוט מנחש מספר טוקנים קדימה ומאיץ את הייצור בלי לשנות את התשובה הסופית.

איך מריצים

מריצים אותו ישירות דרך llama.cpp או Unsloth Studio. החבילה כוללת מודל טיוטה ייעודי מובנה לפיענוח ספקולטיבי (MTP) שמאיץ את פליטת הטוקנים מבלי לפגוע בתוצאה, ושרת llama.cpp מסוגל לזהות אותו אוטומטית כשטוענים את המשקלים. המשקל הכולל של הקבצים בתיקייה הוא 8.6 ג'יגה בייט, כך שכרטיס מסך בסיסי או מחשב נייד עם זיכרון משותף יריצו אותו בלי מאמץ מיוחד.

אם אתם מתכננים לעבד מסמכים ארוכים בני אלפי טוקנים או שאתם צריכים תפוקה יציבה של מענה בעומס גבוה, להחזיק תשתית מקומית בשביל מודל של שני מיליארד פרמטרים זה כאב ראש מיותר. במקרים כאלה עדיף לפנות ל־API חיצוני של דגם גדול יותר, שמציע כושר ניתוח עדיף בהרבה.

ollama run hf.co/unsloth/gemma-4-E2B-it-qat-GGUF:Q4_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשלב אותו במוצרים סגורים, לשנות את הקוד ולהפיץ אותו חופשי, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗