GPT
G

gemma-3-27b-it-int4-awq

קוד פתוח

gaunernstgemma2025-03-21

  • transformers
  • safetensors
  • gemma3
  • image-text-to-text
  • conversational

גרסת INT4 שעברה המרה מ־Flax לפורמט HF ומאפשרת להריץ את Gemma 3 27B על חומרה צנועה בהרבה. היא שומרת על יכולות מולטימודליות וחלון של 128K טוקנים.

  • 27Bפרמטרים
  • 17.2 GBמשקל הקבצים
  • 1,254,752הורדות בחודש
  • 40לייקים

מה זה

גוגל אימנה את מודל 27B על 14 טריליון טוקנים, והגרסה הזו מביאה את משקלי ה־QAT הרשמיים לתוך תשתית נוחה לעבודה במקום קובצי ה־GGUF המקוריים. המודל מקבל טקסט ותמונות ברזולוציה של 896 על 896 ומחזיר טקסט, כשהוא נשען על חלון קלט רחב של 128K טוקנים ופלט של עד 8,192 טוקנים.

במדדים של גוגל, גרסת ה־27B הציגה 85.6 ב־HellaSwag, ציון 78.6 ב־MMLU, ותוצאה של 85.6 ב־DocVQA לניתוח מסמכים חזותי. מדובר בביצועים שמתחרים ישירות במודלים פתוחים כבדים בהרבה, במיוחד כשמדובר בחילוץ מידע מתרשימים ובמשימות היגיון מורכבות.

מתאים ל

  • ניתוח מסמכים ותרשימים

    תוצאה של 85.6 ב־DocVQA ו־76.3 ב־ChartQA מאפשרות לחלץ נתונים מדויקים מדוחות סרוקים.

  • עוזר חזותי מקומי

    המודל דורש כרטיס של 24GB ומאפשר מענה על שאלות מתמונות בלי להעלות מדיה לענן.

  • עיבוד טקסטים ארוכים

    חלון קלט של 128K טוקנים מתאים לתקצור וניתוח של קבצים מרובי עמודים על מחשב יחיד.

איפה זה נופל

במבחן המקודד HumanEval המודל הגיע ל־48.8 בלבד, וב־GPQA השיג 24.3, כך שהוא לא מתאים לכתיבת קוד מורכב או לפתרון שאלות מדעיות ברמת מחקר. התיעוד מציין במפורש שהבדיקות של גוגל נעשו רק באנגלית, כך שהתנהגות בעברית וביצועים מולטימודליים בשפות אחרות מחייבים בדיקה זהירה לפני שילוב במערכת פעילה.

שאלות
נפוצות

האם הקוונטיזציה בוצעה באמצעות ספריית AWQ?

לא. המפרסם השתמש במשקלי QAT INT4 המקוריים שגוגל שחררה ב־Flax, והמיר אותם למבנה של AWQ כדי לאפשר טעינה בספריית transformers.

איזה מעבד גרפי נדרש בפועל להרצה?

המודל תופס 17.2 גיגה־בייט, ולכן דרוש כרטיס מסך עם 24GB VRAM כדי להריץ אותו יחד עם הקשר של טקסט ותמונות.

האם המודל תומך בעברית?

האימון כלל מעל 140 שפות, אך כרטיס המודל מציין שבדיקות הבטיחות והערכות המקוריות נערכו באנגלית בלבד.

איך מריצים

המשקל הכולל ירד ל־17.2 גיגה־בייט ב־18 קבצים, כך שכרטיס בודד של 24GB VRAM כמו RTX 3090 או RTX 4090 מספיק כדי להעלות אותו לזיכרון. ההרצה נעשית ישירות דרך ספריית transformers, תוך שימוש בגרסה המותאמת וב־pipeline של image-text-to-text.

אם אתם צריכים רק שאילתות טקסט בודדות פעם ביום, החזקת GPU ייעודי עבור 17 גיגה־בייט עולה יותר מפנייה ישירה ל־API מסחרי. ההרצה העצמית משתלמת כשאתם מעבדים מסמכים רגישים שאסור להוציא החוצה או כשרוצים לבצע עיבוד תמונה מקומי ברצף בלי תלות ברשת.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="gaunernst/gemma-3-27b-it-int4-awq")
print(pipe("שלום"))

הרישיון

השימוש כפוף לתנאי הרישיון של Gemma מבית גוגל. הרישיון מאפשר שימוש מסחרי, אך כולל הגבלות שימוש ספציפיות ומדיניות בטיחות של גוגל שחייבים לפעול לפיהן בעת הפצת יישום שמבוסס עליו.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗