GPT
A

Apriel-Nemotron-15b-Thinker

קוד פתוח

ServiceNow-AImit2025-05-06

  • transformers
  • safetensors
  • mistral
  • text-generation
  • conversational

זה מודל חשיבה ונימוק של 15 מיליארד פרמטרים שמתחרה בדגמים כבדים ממנו בהסקה לוגית וקוד. הוא מכוון לביצועים של מודלי 32B בחצי מנפח הזיכרון ובפחות טוקנים לתשובה.

  • 15Bפרמטרים
  • 65,536טוקנים בהקשר
  • 27.9 GBמשקל הקבצים
  • 5,533הורדות בחודש

מה זה

מדובר במודל שמבוסס על צ'קפוינט הבסיס Apriel 15B, ועבר הכשרה ייעודית בשלושה שלבים שכוללת אימון המשך על מעל מאה מיליארד טוקנים של מתמטיקה, קוד ומדע, כוונון עם 200 אלף דוגמאות, וחיזוק באמצעות GRPO כדי לסגור פערים בהבנת פקודות מורכבות וקריאות לפונקציות. המבנה שלו מבוסס על ארכיטקטורת Mistral ומחזיק חלון הקשר של 65,536 טוקנים.

במקום לייצר תשובות ישירות, הוא פועל כמודל חשיבה שמפרט קודם את שלבי הניתוח ורק אז פולט את התשובה הסופית. לפי הנתונים של ServiceNow הוא מציג חסכון של 40 אחוזים בטוקנים לעומת מודלים כמו QWQ 32B באותן משימות, ומגיע לתוצאות מקבילות או עדיפות במבחני תכנות, שליפת מידע ארגונית ומעקב אחרי הוראות, תוך תפיסת משאבים שנמוכה בחצי.

מתאים ל

  • קריאות לפונקציות וסוכנים

    אימון ה־GRPO כוון ספציפית למבחני BFCL ופקודות מורכבות, מה שמתאים לשילובו כמנוע קבלת החלטות במערכות תוכנה.

  • שליפת מידע ארגונית

    המודל עבר אופטימיזציה לתרחישי Enterprise RAG כדי לתמצת ולעבד מסמכים ארוכים בהקשר של 65K בלי לאבד פרטים.

  • פתרון בעיות מתמטיקה וקוד

    הוא כולל שלבי חשיבה מובנים שנבחנו מול תחרויות כמו AIME ו־MBPP, ומתאים לפתרון בעיות שדורשות ניתוח צעד אחר צעד.

איפה זה נופל

היוצרים מודים במפורש שהביצועים החזקים שלו מוגבלים לאנגלית ואיכות הפלט צונחת בשפות אחרות, מה שאומר שעבור עברית הוא ידרוש בדיקות מחמירות וכנראה לא יתפקד טוב ברמות מורכבות. בנוסף, מדובר במודל שעלול לפלוט עובדות שגויות ומיושנות, והוא אינו מיועד למערכות קריטיות ללא בדיקת אדם. שלב הנימוק אמנם מובנה, אבל הוא לא מונע הזיות לחלוטין.

שאלות
נפוצות

האם המודל מתאים לשימוש בעברית?

הכרטיס מציין בפירוש שהיכולות נבנו ונבדקו באנגלית, ואיכות הפלט נפגעת בשפות פחות מיוצגות. אם הממשק או המידע שלכם בעברית, צפו לפספוסים בהוראות מורכבות.

למה המודל מחזיר שלבי מחשבה ולא ישר תשובה?

הוא מאומן לעצור ולפרק את הבעיה לפני מתן מענה. הפלט כולל בלוק של תהליך ההסקה ולאחריו את התשובה הסופית, כך שהתוכנה שלכם צריכה לדעת לחלץ את הטקסט שבין התגיות הייעודיות.

איך מריצים

המשקל הגולמי של הקבצים בפורמט bfloat16 עומד על 27.9 גיגה בייט. זה אומר שבשביל להריץ אותו בלי כימות צריך לפחות כרטיס מקצועי אחד עם 32 או 48 גיגה בייט זיכרון כמו A6000 או A100, בייחוד אם רוצים לנצל הקשרים ארוכים מתוך הטווח המלא של 65 אלף טוקנים. אם מכמתים אותו לפורמט של 4 ביט הוא ייכנס גם על כרטיס צרכני של 16 גיגה בייט.

ההרצה מתבצעת ישירות בספריית transformers עם התבנית המובנית שכוללת פרומפט מערכת קבוע וטמפרטורה מומלצת של 0.6. אם אין לכם שרת ייעודי שפועל ברציפות, החזקה של חומרה כזו עולה לא מעט, ולכן במקרים של עומסים משתנים או בדיקות ראשוניות פשוט יותר לחבר API חיצוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="ServiceNow-AI/Apriel-Nemotron-15b-Thinker")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון MIT, מה שנותן חופש כמעט מוחלט. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים, בלי דרישה לחלוקת קוד חזרה. התנאי היחיד הוא השארת הודעת זכויות היוצרים והפטור מאחריות בקבצים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗