GPT
G

G9v3-39A5B

קוד פתוח

ai9starsapache-2.02026-07-21

  • transformers
  • safetensors
  • g9v3
  • text-generation
  • moe

ארכיטקטורת מומחים שדורשת זיכרון של מודל בינוני אבל מפעילה רק חמישה מיליארד פרמטרים בכל טוקן. מקבלים קיבולת וידע רחב בלי לשלם בזמן עיבוד איטי.

  • 39Bפרמטרים
  • 131,072טוקנים בהקשר
  • 72.6 GBמשקל הקבצים
  • 2,798הורדות בחודש

מה זה

מדובר במודל MoE שמחזיק קרוב ל־39 מיליארד פרמטרים בסך הכול, אך בכל פעולת חישוב ניגש רק לכחמישה מיליארד מתוכם. השילוב הזה נותן מהירות תגובה שמזכירה מודלים קטנים, יחד עם עומק הבנה ששמור למשקלים כבדים יותר. הוא מיועד לשימושי עוזר, כתיבת קוד, הסקת מסקנות והפעלת כלים חיצוניים.

נקודה מעניינת בהרצה שלו היא התמיכה במצב חשיבה לצד מצב רגיל מתוך אותו קובץ משקלים. אתם שולטים בזה ישירות דרך הגדרות הטמפרטורה והטוקנייזר. בנוסף, חלון ההקשר מגיע ל־131,072 טוקנים, מה שמאפשר להזין תיעוד טכני נרחב או קטעי קוד ארוכים למדי בלי לאבד את ההקשר.

מתאים ל

  • פיתוח כלי קוד פנימיים

    זמני תגובה מהירים של חמישה מיליארד פרמטרים פעילים, שמתאימים לעבודה מול מאגרי קוד באנגלית.

  • ניתוח מסמכים ארוכים

    חלון של 131,072 טוקנים מאפשר לקרוא קבצים שלמים בלי לקטוע את המידע לחלקים קטנים.

  • סוכנים מבוססי כלים

    ארכיטקטורה שמכוונת ספציפית לתהליכי Tool use עם אפשרות למעבר בין מצב חשיבה לתשובה ישירה.

איפה זה נופל

המודל הוגדר רשמית עבור אנגלית וסינית בלבד, כך שאין שום הבטחה לגבי איכות העברית שלו, וכנראה שהוא יתקשה או יג'ברש בניסוחים מורכבים. מעבר לכך, היוצרים מצהירים במפורש שמדובר בגרסת תצוגה מקדימה, מה שאומר שההתנהגות שלו עלולה להשתנות בעדכונים הבאים. הוא נוטה להזיות ולשגיאות סטטיסטיות, כך שאי אפשר להסתמך עליו בעיניים עצומות למשימות קריטיות בלי שכבת בדיקה ידנית.

שאלות
נפוצות

איך עוברים בין מצב חשיבה למצב רגיל?

השליטה נעשית דרך הטמפרטורה והטוקנייזר בקוד ההרצה. למצב חשיבה מעבירים את הדגל enable_thinking כחיובי ומכוונים לטמפרטורה 1.0, ועבור תשובה רגילה וישירה מכבים את הדגל ומורידים לטמפרטורה 0.7.

האם המודל יתאים למוצר שמיועד לדוברי עברית?

הכרטיס מפרט תמיכה באנגלית ובסינית בלבד. אם המוצר שלכם צריך לייצר או להבין עברית שוטפת, עדיף לבדוק מודלים אחרים או לבצע בדיקה מדגמית קפדנית, כי סביר להניח שהביצועים בשפה לא יהיו יציבים.

איך מריצים

כדי לארח אותו עצמאית תצטרכו שרת עם לפחות 80 עד 100 גיגה זיכרון גרפי, למשל כרטיס A100 או שני כרטיסי 48 גיגה, רק בשביל להחזיק את 72.6 הגיגה של המשקלים בזיכרון. המודל נתמך ישירות בספריות vLLM ו־SGLang, מה שמקל מאוד על הרמת שרת תואם OpenAI בפורט מקומי.

אם אין לכם חומרה כזו זמינה, מודלים בגודל הזה כבדים מדי להרצה על מחשב אישי רגיל ללא קוונטיזציה כבדה. במקרה כזה, עדיף להמתין לחלופות ענן או לפנות ל־API מסחרי מוכן אם המטרה היא בדיקת היתכנות מהירה בלבד.

from transformers import pipeline

pipe = pipeline("text-generation", model="ai9stars/G9v3-39A5B")
print(pipe("שלום"))

הרישיון

הפרויקט והמשקלים מופצים תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי מלא, שינוי של הקוד והמשקלים, שילוב במוצרים סגורים והפצה מחדש, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗