GPT
G

Gemma-3-R1984-4B

קוד פתוח

VIDraftgemma2025-04-09

  • transformers
  • safetensors
  • gemma3
  • image-text-to-text
  • conversational

גרסה פתוחה ללא צנזורה על בסיס גמא 3 של גוגל, עם יכולות עיבוד של תמונות, וידאו ומסמכים. מתאימה למי שרוצה להריץ סוכן מחקר מקומי ולא מוכן שחברות ענן יסננו לו את התשובות.

  • 4.3Bפרמטרים
  • 131,072טוקנים בהקשר
  • 8.0 GBמשקל הקבצים
  • 124הורדות בחודש

מה זה

הבסיס כאן הוא מודל של 4.3 מיליארד פרמטרים שיושב בארכיטקטורת Gemma3 For Conditional Generation, אבל עבר התאמה לתפקד כסוכן מחקר עצמאי. מעבר לקריאת טקסט רגילה, המערך תומך ישירות בקבצי PDF, גיליונות CSV, סרטוני MP4 ותמונות שונות, ומשלב חיפוש רשת חי באמצעות מפתח חיצוני שמחזיר עד 20 תוצאות ומצטט מקורות ישירות בגוף התשובה.

היוצרים שלו מכוונים למענה ישיר בלי פילטרים ומחסומי תוכן רגילים, תוך שימוש בשרשראות חשיבה מורחבות לצורך פתרון בעיות. למרות שמבנה הבסיס תומך בחלון רחב בהרבה, היישום הנוכחי מגביל את העיבוד בפועל לאורך של עד 8,000 טוקנים ומאפשר לשלוח עד 5 תמונות בכל פנייה בברירת המחדל.

מתאים ל

  • סריקת מסמכים מקומית

    ניתוח ישיר של קובצי PDF וגיליונות CSV בתוך השרת שלכם בלי לשלוח מידע פנימי לרשת חיצונית.

  • תחקור תמונות ווידאו

    מענה על שאלות חזותיות מתוך קובצי MP4 ותמונות שונות בעזרת מודל קומפקטי יחסית.

  • מחקר אוטונומי ברשת

    איסוף עובדות בזמן אמת מתוך 20 תוצאות חיפוש ברשת עם הפניה למקורות בגוף התשובה.

איפה זה נופל

הפער בין נתוני הבסיס של המודל למימוש שלו בולט מאוד. הארכיטקטורה אמנם תומכת בחלון של מעל 131,000 טוקנים, אבל הקוד כאן חותך את הטיפול בטקסט כבר ב־8,000 טוקנים בלבד. מעבר לזה, רשימת השפות הנתמכות כוללת אנגלית, ערבית, ספרדית ועוד כמה שפות נפוצות, אך עברית אינה מופיעה ברשימה הרשמית. היכולת לתת תשובות לא מצונזרות אומרת גם שאין שום מנגנון בטיחות פנימי, כך שכל האחריות על אימות התוכן והגבלת פלטים בעייתיים נופלת כולה עליכם.

אותה משפחה

Gemma-3-R1984 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב נייד חזק?

לא. למרות שמדובר במודל של 4.3 מיליארד פרמטרים, הדרישה המפורשת היא כרטיס גרפי ייעודי לשרתים עם לפחות 24 גיגה זיכרון גרפי, עקב זינוקים בצריכת הזיכרון שמגיעים עד 82 גיגה בזמן ריצה.

האם הוא יכול לחפש באינטרנט בצורה עצמאית לגמרי?

לא באופן מנותק. המנגנון הפנימי דורש מפתח API פעיל לשירות SERPHouse, שממנו הוא מושך עד 20 תוצאות בכל שאילתה לפני ניתוח הנתונים.

האם הוא מתאים לעיבוד טקסטים ארוכים במיוחד?

המודל מוגבל בפועל ל־8,000 טוקנים בכל קלט, למרות שהבסיס הטכני מסוגל ליותר. אם יש לכם קבצים גדולים שממלאים עשרות אלפי טוקנים, תצטרכו לפצל אותם מראש.

איך מריצים

המשקל הכולל של הקבצים עומד על 8 גיגה בייט בדיוק של bfloat16, אבל אל תתנו למשקל הקובץ להטעות אתכם. לפי הדרישות, צריך לפחות 24 גיגה בייט של זיכרון גרפי כדי להפעיל אותו, עם המלצה על מאיצים כמו L40s, L4 או A100. היוצרים מזהירים מראש שצריכת הזיכרון הגרפי עלולה לזנק זמנית לאזור ה־82 גיגה בייט בזמן עיבוד מורכב, כך שכרטיס מסך ביתי רגיל פשוט יתרסק.

סביבת הריצה דורשת פייתון 3.8 ומעלה וחבילות נלוות כמו Gradio, PyTorch, PyPDF2 ו־OpenCV. בנוסף, מי שרוצה להשתמש ביכולות החיפוש ברשת מחויב להגדיר מפתח ייעודי מול שירות SERPHouse, מה שאומר שתצטרכו תלות חיצונית נוספת כדי לקבל את תכונות המחקר המלאות.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="VIDraft/Gemma-3-R1984-4B")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר תחת תנאי השימוש של gemma מבית גוגל, כאשר קוד הסוכן מתויג ברישיון MIT. רישיון גמא דורש ציות למדיניות השימוש וההפצה המקורית של גוגל, דבר שיוצר סתירה מסוימת עם ההבטחה לתשובות נטולות צנזורה. אם אתם מתכננים להטמיע אותו במוצר מסחרי, תצטרכו לוודא שהשימוש שלכם עומד בהגבלות השימוש המקוריות שגוגל מחייבת ברישיון הבסיס.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗