GPT
G

bartowski/gemma-4-12B-it-GGUF

קוד פתוח

bartowskiapache-2.02026-06-03

  • gguf
  • image-text-to-text
  • endpoints_compatible
  • conversational

גרסת GGUF מכווצת של מודל Gemma 4 עם 12 מיליארד פרמטרים מבית גוגל. הוא מיועד למי שרוצה להריץ מודל משולב תמונה וטקסט מקומית על החומרה שלו בלי לגעת בשרתים חיצוניים.

  • 185 GBמשקל הקבצים
  • 38,961הורדות בחודש
  • 46לייקים

מה זה

מדובר במודל רב מודלי של גוגל שעבר המרה וכימוס בשיטת imatrix על ידי המשתמש bartowski באמצעות llama.cpp. המודל מסווג למשימות תמונה לטקסט וטקסט לטקסט, ומגיע בתבנית שיחה מוגדרת שכוללת תגיות מערכת, משתמש, וערוץ מחשבה מובנה של המודל.

הייחוד כאן הוא המגוון הרחב של גרסאות הכימוס, החל מגרסת bf16 מלאה בגודל 23.83GB ועד כימוסי 2 ביט קיצוניים שיורדים ל־4.71GB. ברמות הביניים, חלק מהגרסאות כמו Q4_K_L שומרות על משקולות הפלט וההטמעה באיכות גבוהה יותר של Q8_0 כדי למזער פגיעה באיכות התוכן בלי לנפח את שאר המודל.

מתאים ל

  • ניתוח מסמכים ותמונות מקומי

    מאפשר לחלץ מידע מתמונות ומסמכים סרוקים ישירות על המחשב ללא שליחת מידע רגיש לענן.

  • עוזר פיתוח מקומי מבוסס שיחה

    מנצל את מבנה הפרומפט המובנה ותגיות המחשבה כדי לענות על שאלות קוד ולתכנן פתרונות.

  • הרצה על חומרת קצה מוגבלת

    גרסאות ה־IQ4 וה־Q4 מאפשרות לשלב את המודל במחשבים אישיים עם כרטיס מסך בודד או מעבדי ARM.

איפה זה נופל

הקובץ המקורי מכווץ כאן בצורה אגרסיבית, ובגרסאות הנמוכות מ־Q4, במיוחד בגרסאות ה־2 ביט, יש ירידה מורגשת באיכות הפלט והכרטיס עצמו מציין שהן מיועדות בעיקר למצבי מחסור קיצוני בזיכרון. בנוסף, אם הכלי שבו אתם משתמשים לא מעודכן לגרסאות llama.cpp האחרונות, הוא עשוי לא לתמוך במודל או בסידור המשקולות החדש.

שאלות
נפוצות

איזה קובץ ספציפי כדאי להוריד למחשב שלי?

אם יש לכם כרטיס מסך מודרני עם מספיק זיכרון, בחרו ב־Q4_K_M או Q5_K_M לאיזון מדויק בין משקל לאיכות. במערכות עם מעט זיכרון פנימי, גרסאות ה־I-quants כמו IQ4_XS יספקו ביצועים עדיפים בגודל קטן יותר.

האם חייבים להוריד את כל התיקייה של 185GB?

ממש לא. צריך להוריד אך ורק קובץ GGUF בודד שמתאים למגבלות החומרה שלכם, תוך שימוש בכלי ההורדה עבור הקובץ הספציפי שנבחר.

איך מריצים

כדי לקבל ריצה חלקה ומהירה, המודל כולו צריך לשבת בזיכרון של כרטיס המסך. לרוב המפתחים, גרסת Q4_K_M ששוקלת 7.66GB תהיה נקודת ההתחלה המאוזנת, והיא תדרוש כרטיס עם לפחות 10GB עד 12GB של VRAM כדי להשאיר מקום להקשר. אם יש לכם כרטיס של 8GB, תצטרכו לרדת לגרסאות מכווצות יותר כמו IQ3_M או Q3_K_L, ששוקלות פחות מ־6.5GB.

את הקבצים מריצים ישירות בכלים מוכרים כמו llama.cpp, LM Studio, koboldcpp או Jan AI. אם יש לכם מעבד ARM או מעבד עם AVX, גרסת Q4_0 תבצע סידור מחדש של המשקולות בזיכרון בזמן ריצה כדי להאיץ את העיבוד. אם אין לכם חומרה מקומית מתאימה ואתם צריכים רק שאילתות מזדמנות, עדיף להשתמש ב־API חיצוני.

ollama run hf.co/bartowski/gemma-4-12B-it-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי הקוד והפצה של המודל בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗