GPT
G

Gemma-3-R1984-12B-Q8_0-GGUF

קוד פתוח

openfreegemma2025-03-30

  • transformers
  • gguf
  • llama-cpp
  • gguf-my-repo
  • image-text-to-text

גרסת קוונטיזציה של מודל מולטימודלי בגודל 12 מיליארד פרמטרים, ארוזה בפורמט שרץ ישירות על מעבדים מקומיים. היא מתאימה למי שרוצה לעבד תמונה וטקסט בלי להסתמך על שרתי ענן חיצוניים.

  • 11.7 GBמשקל הקבצים
  • 79הורדות בחודש
  • 126לייקים

מה זה

מדובר בהמרה לפורמט GGUF של המודל Gemma-3-R1984-12B, שבוצעה באמצעות llama.cpp. המודל שייך למשפחת מודלי תמונה לטקסט, כך שהוא מסוגל לקבל קלט משולב של תמונות ומלל ולייצר תשובות טקסטואליות. בסיס המודל תומך במספר שפות מרכזיות, ביניהן אנגלית, ערבית, ספרדית, רוסית ושפות אסייתיות, אך עברית אינה מופיעה ברשימת השפות הרשמית שלו.

המשקל הנוכחי בכימות Q8_0 שומר על דיוק גבוה מאוד ביחס למודל המקורי, כמעט ללא שחיקה בביצועים, אך המחיר הוא קבצים כבדים יחסית שנפחם הכולל מגיע ל־11.7 גיגה בייט. יוצרי ההמרה לא פרסמו מדדי ביצועים עצמאיים או השוואות כמותיות מול גרסאות אחרות של Gemma בכרטיס המודל, אלא התמקדו באספקת קובץ בינארי שמוכן לטעינה ישירה. בשוק שבו רוב המודלים המולטימודליים דורשים תשתית ענן מורכבת, הפורמט הזה מאפשר להריץ מודל ראייה וטקסט של 12 מיליארד פרמטרים גם במחשב מקומי, כל עוד יש זיכרון שמסוגל להכיל אותו.

מתאים ל

  • ניתוח תמונות באנגלית במחשב

    מאפשר פענוח תמונות והפקת תובנות מקומית ללא תלות ברשת או חשש מדליפת מידע פרטי.

  • חילוץ טקסט מתמונות בשפות זרות

    מתאים לזיהוי ותמלול מסמכים בשפות הנתמכות כמו ערבית, רוסית או שפות מזרח אסיה.

  • פיתוח פנימי ללא תשלום לענן

    מספק סביבת בדיקות עצמאית למפתחים שרוצים לבחון שילוב מולטימודלי בלי עלויות לפי טוקן.

איפה זה נופל

החיסרון הבולט הוא היעדר מוחלט של עברית ברשימת השפות הנתמכות, מה שאומר שכל ניסיון לעבד טקסט עברי או לחלץ מידע מתמונות עם כיתוב מקומי עלול להסתיים בפלט משובש. בנוסף, כרטיס המודל לא חושף איזה אימון נוסף עבר הדגם המקורי ומה המשמעות של התוספת R1984, כך שאין תיעוד לגבי הטיות או סינונים מיוחדים שהוכנסו בו. לפני שמשלבים אותו במערכת ייצור, חייבים לבדוק עצמאית את היציבות שלו ואת אופן הטיפול בתמונות מורכבות.

שאלות
נפוצות

האם המודל יפעל היטב עם טקסט ותמונות בעברית?

עברית אינה מוגדרת ברשימת השפות הנתמכות של המודל. אפשר לנסות להזין לו פרומפטים בעברית, אך קיים סיכוי גבוה להזיות, שגיאות דקדוקיות או כשל בפענוח כיתוב עברי מתוך תמונות.

כמה זיכרון נדרש בפועל כדי להריץ את גרסת ה־Q8_0?

הקבצים לבדם תופסים 11.7 גיגה בייט. מומלץ להחזיק לפחות 16 גיגה בייט של זיכרון מערכת פנוי או VRAM ייעודי כדי לפתוח חלון הקשר סביר בלי לקרוס.

למה להשתמש בגרסת Q8_0 במקום קוונטיזציה נמוכה יותר?

כימות Q8 שומר על דיוק כמעט זהה למודל המקורי ללא אובדן איכות מורגש בתשובות. החיסרון הוא נפח קובץ גדול שמצריך יותר זיכרון בהשוואה לגרסאות דחוסות כמו Q4.

איך מריצים

ההרצה נעשית ישירות דרך llama.cpp, מהטרמינל או בהרמת שרת פנימי מקומי. מכיוון שהקובץ שוקל 11.7 גיגה בייט, תצטרכו לפחות 16 גיגה בייט של זיכרון כדי להחזיק את המודל ואת ההקשר שלו, בין אם מדובר בכרטיס מסך עם VRAM מתאים ובין אם בזיכרון מאוחד במחשבי מק.

אם אין לכם כרטיס גרפי מתאים, המודל יעלה על מעבד רגיל אבל ייצר טקסט בקצב אטי שמקשה על שימוש אינטראקטיבי. במצב כזה, או אם אתם מתכננים מוצר שצריך לשרת משתמשים רבים במקביל, כנראה עדיף להשתמש בנקודת קצה מנוהלת דרך ענן במקום לקנות חומרה ייעודית.

ollama run hf.co/openfree/Gemma-3-R1984-12B-Q8_0-GGUF:Q8_0

הקבצים

3 קבצים במאגר, 11.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון gemma של גוגל. הרישיון מאפשר שימוש מסחרי, אך הוא כפוף לתנאי השימוש ולהגבלות הבטיחות של משפחת מודלי Gemma, שדורשים ציות לכללי שימוש הוגן ואחריות על התוכן המופק.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗