GPT
N

Nemotron-Mini-4B-Instruct

קוד פתוח

nvidiaother2024-09-10

  • transformers
  • pytorch
  • nemo
  • nemotron
  • text-generation

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל קומפקטי של אנבידיה שפותח מכיווץ גרסה של 15B, ומיועד להרצה מקומית עבור משחקי תפקידים, הפעלת כלים וחיפוש מבוסס RAG.

  • 4,096טוקנים בהקשר
  • 15.6 GBמשקל הקבצים
  • 72,460הורדות בחודש
  • 186לייקים

מה זה

אנבידיה לקחה את Nemotron-4 15B וכיווצה אותו באמצעות גיזום וזיקוק כדי ליצור מודל קל שמתאים למכשירים מקומיים. המטרה כאן היא לתת מענה ספציפי למשימות שיחה, משחקי תפקידים עבור דמויות במשחקים, שליפת מידע מבוססת מסמכים וקריאה לפונקציות. הוא מתבסס על ארכיטקטורת Nemotron-4 עם Grouped-Query Attention וכולל 32 שכבות בדיוק של bfloat16.

במקום לנסות לפתור הכל, הוא מתרכז במשימות מוגדרות מראש באנגלית. אם אתם צריכים סוכן מקומי שמריץ כלים או דמות שמגיבה בזמן אמת בלי לצאת לענן, הדחיסה הזו נותנת מענה מדויק יותר מסתם מודל כללי קטן, אבל מוגבלת לחלוטין לגבולות הגזרה האלה.

מתאים ל

  • דמויות NPC במשחקי מחשב

    פותח במקור לשילוב מקומי במשחקים בעזרת NVIDIA ACE עבור דיאלוגים מותאמים אישית.

  • הפעלת פונקציות וכלים

    כולל תמיכה מובנית בפורמט ייעודי לקריאה לפונקציות וקבלת תוצאות בצורה מובנית.

  • מענה על שאלות RAG באנגלית

    מתאים לשליפת מידע מהקשר קצר של עד 4,096 טוקנים על גבי מכונות מקומיות.

איפה זה נופל

המודל אומן רק על אנגלית, כך שאין מה לבנות עליו לממשקים בעברית. חלון ההקשר עומד על 4,096 טוקנים בלבד, מה שמגביל מאוד תהליכי RAG עם מסמכים ארוכים או שיחות מתמשכות.

הכרטיס מודה במפורש שהאימון כלל דאטה גולמי מהרשת שכולל הטיות ושפה רעילה, והמודל עלול לפלוט תשובות לא מדויקות, פוגעניות או להמציא דברים, בייחוד אם סוטים מתבנית הפרומפט המדויקת שלו. חובה לבדוק ולסנן את הפלטים לפני שמשלבים אותו במערכת אמיתית.

שאלות
נפוצות

האם המודל תומך בעברית?

התיעוד מגדיר את המודל לשפה האנגלית בלבד. הוא לא אומן ולא מיועד לעבודה בעברית, ולכן פלטים בשפה זו יהיו משובשים או שגויים לחלוטין.

האם חייבים להשתמש בתבנית הפרומפט של אנבידיה?

כן. הכרטיס מציין שהמודל עבר כוונון ישירות על התבנית שמכילה תגיות ייעודיות כמו extra_id ו־toolcall. סטייה מהתבנית פוגעת ישירות באיכות התשובות ועלולה להגביר פליטת טקסט שגוי או רעיל.

איך מריצים

המשקלים מגיעים בנפח של 15.6GB ומיועדים לטעינה דרך ספריית transformers הרגילה, תוך שימוש בפורמט הפרומפטים הייחודי של אנבידיה שכולל תגיות כמו extra_id. בדיוק המקורי נדרש כרטיס מסך עם לפחות 16GB זיכרון כדי לטעון אותו ולעבוד בנוחות, אם כי המודל עבר אופטימיזציה לכימות עבור חומרת קצה.

אפשר לבדוק אותו ישירות בענן של build.nvidia.com לפני שמורידים קבצים. אם אין לכם חומרה מקומית חזקה או שאתם לא חייבים השהיה אפסית עבור משחק או מכשיר קצה, עדיף להשתמש בנקודת הקצה שלהם במקום להחזיק שרת ייעודי.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/Nemotron-Mini-4B-Instruct")
print(pipe("שלום"))

הרישיון

הרישיון הוא NVIDIA Community Model License. הוא מוגדר בכרטיס כמוכן לשימוש מסחרי, אך כולל תנאים משפטיים ספציפיים של אנבידיה שמופיעים בקובץ הרישיון המצורף, ולכן יש לבדוק את פרטי המסמך לפני הטמעה במוצר מסחרי.

הרישיון המלא בעמוד המודל ↗