GPT
G

G9v3-3B

קוד פתוח

ai9starsapache-2.02026-07-21

  • transformers
  • safetensors
  • llama
  • text-generation
  • g9v3

מודל צפוף בגודל שלושה מיליארד פרמטרים שמציע חלון הקשר ענק של 131 אלף טוקנים. הוא פונה למי שחייב הרצה מקומית על חומרה צנועה למשימות קוד וסוכנים בלי לשלם על שרתים יקרים.

  • 3Bפרמטרים
  • 131,072טוקנים בהקשר
  • 5.6 GBמשקל הקבצים
  • 3,044הורדות בחודש

מה זה

מדובר במודל שפה קומפקטי שמבוסס על ארכיטקטורת Llama רגילה, ומכוון לתרחישים של משאבים מוגבלים. הוא נבנה עבור עבודה כעוזר אישי, משימות תכנות, חשיבה והפעלת כלים. נקודת המפתח פה היא חלון ההקשר, שמגיע ל־131,072 טוקנים, נתון חריג מאוד למודל קטן ששוקל 5.6 גיגה־בייט בלבד.

היוצרים הטמיעו בו מצב חשיבה מובנה שניתן להדליק או לכבות ישירות בטמפלייט של הצ'אט. מעבר לזה, הכרטיס אינו כולל ציוני מבחנים או טבלאות ביצועים מול מודלים מתחרים, כך שקשה לדעת מראש איך הוא מתמודד מול חלופות מוכרות בקטגוריה.

מתאים ל

  • סוכן מקומי להפעלת כלים

    מתאים לחיבור לפונקציות מקומיות בזכות גודל מינימלי וזיכרון נמוך.

  • ניתוח מסמכים ארוכים באנגלית

    חלון של 131 אלף טוקנים מאפשר לקרוא קבצים גדולים במחשב האישי.

  • עוזר קידוד על מחשב נייד

    רץ ישירות על מעבד גרפי מקומי בלי לשלוח קוד פנימי החוצה.

איפה זה נופל

היוצרים מציינים שהמודל עלול לייצר פלט לא מדויק, מוטה או לא בטוח, ומבוסס על תבניות סטטיסטיות בלבד. אסור להסתמך עליו בעיניים עצומות במערכות קריטיות. מעבר לזה, הוא אומן רק על אנגלית וסינית, כך שאינו מתאים לעבודה בעברית. היעדר מדדי ביצועים רשמיים מחייב אתכם לבדוק את איכות הקוד והלוגיקה שלו לפני שילוב בקוד אמיתי.

שאלות
נפוצות

האם המודל מבין ומייצר עברית?

המודל מוגדר רשמית עבור אנגלית וסינית בלבד. הוא לא עבר אימון מוצהר על עברית, ולכן פלט בעברית יהיה מקוטע או שגוי לחלוטין.

איך משפיע מצב החשיבה על התשובות?

הפעלת הפרמטר enable_thinking מעבירה את המודל למצב חשיבה עם הגדרות טמפרטורה שונות. זה עוזר בפירוק בעיות לוגיות, אך מאט את קצב הפקת התשובה.

איך מריצים

במשקל של 5.6 גיגה־בייט בפורמט bfloat16, המודל רץ בנוחות על כרטיס מסך ביתי בודד עם 8 עד 12 גיגה זיכרון. אפשר להעלות אותו ישירות דרך מנועים כמו vLLM או SGLang לפרודקשן, או בסקריפט פייתון קצר עם transformers.

אם אתם מתכוונים לנצל את מלוא חלון ההקשר, הזיכרון שיידרש ל־KV cache יגדל משמעותית ויחייב כרטיס חזק בהרבה. במקרה כזה, אלא אם המידע חייב להישאר אצלכם מטעמי פרטיות, זול ופשוט יותר לשלוח קריאות API למודלים מנוהלים ברשת.

from transformers import pipeline

pipe = pipeline("text-generation", model="ai9stars/G9v3-3B")
print(pipe("שלום"))

הרישיון

הפרויקט והמשקלים מופצים תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה פנימית או מסחרית במוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗