GPT
D

deepseek-math-7b-base

קוד פתוח

deepseek-aiother2024-02-05

  • transformers
  • pytorch
  • llama
  • text-generation
  • text-generation-inference

בסיס מתמטי של שבעה מיליארד פרמטרים שמיועד להמשך אימון וחישובים. הוא נותן נקודת זינוק זולה וממוקדת למי שצריך מודל שמבין נוסחאות בלי להחזיק מפלצת יקרה.

  • 4,096טוקנים בהקשר
  • 12.9 GBמשקל הקבצים
  • 3,031הורדות בחודש
  • 90לייקים

מה זה

מדובר במודל שפה בגודל שבעה מיליארד פרמטרים, בארכיטקטורת LlamaForCausalLM עם שלושים שכבות, שכוונן ספציפית לעולמות המתמטיקה. הוא עובד על חלון הקשר קצר יחסית של 4,096 טוקנים ובדיוק bfloat16, מה שמגדיר בדיוק לאיזה סוג משימות הוא מיועד. במקום לנסות לדעת הכל קצת, הוא מתמקד בהשלמת טקסט, הוכחות ונוסחאות מתמטיות.

ההבדל המשמעותי בינו לבין מודלים כלליים אחרים בגודל הזה הוא בסיס הנתונים המתמטי שעליו אומן. הוא לא מגיע כדי לנהל שיחה נעימה עם משתמשי קצה, אלא כדי לשמש מנוע חישובי או שלד להמשך כוונון. בעוד מודלים רגילים באותו סדר גודל נוטים לקרוס או להמציא פתרונות כשמציגים להם אינטגרלים מורכבים, כאן המבנה כולו מכוון להסקת מסקנות כמותית.

מתאים ל

  • בסיס לכוונון אלגוריתמי

    נקודת מוצא זולה לאימון נוסף על נתונים מתמטיים או טכניים פרטיים של הארגון.

  • השלמת חישובים ונוסחאות

    השלמת טקסט מדויקת לביטויים אלגבריים ואינטגרלים בתוך צינורות עיבוד קיימים.

  • סביבת מחקר ופיתוח

    בדיקת יכולות הסקה מתמטית על חומרה מקומית צנועה של 16 גיגה זיכרון.

איפה זה נופל

זהו מודל בסיס, כלומר הוא לא עבר התאמה להוראות ואינו צ'אט. אם תזרקו לו שאלה רגילה, הוא ימשיך את המשפט במקום לפתור אותה, ואי אפשר להסתמך עליו כעוזר אישי מוכן מהקופסה. בנוסף, חלון ההקשר מוגבל ל־4,096 טוקנים בלבד, כך שלא תוכלו להזין לתוכו מאמרים שלמים, הוכחות ארוכות במיוחד או קטעי קוד מורכבים מבלי לחתוך אותם מראש.

אותה משפחה

deepseek-math יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יכול לענות ישירות על שאלות מתמטיות מילוליות?

לא בצורה ישירה של שיחה. זהו מודל בסיס שנועד להשלמת טקסט בלבד, ולכן הוא ינסה להמשיך את הניסוח במקום להחזיר תשובה מסודרת כמו מודל שעבר כוונון הנחיות. כדי להשתמש בו לפתרון שאלות יש לנסח פרומפטים שמתחילים את החישוב, או לאמן אותו תחילה.

איזו חומרה מינימלית צריך כדי לטעון אותו בעבודה?

הקבצים שוקלים 12.9 גיגה-בייט ונטענים בדיוק bfloat16. בפועל נדרש כרטיס מסך אחד עם 16 גיגה-בייט זיכרון לפחות כדי להחזיק את המשקלים והאקטיבציות הבסיסיות של חלון ההקשר.

איך מריצים

המשקל הכולל של הקבצים עומד על 12.9 גיגה-בייט, מה שאומר שכדי להריץ אותו מקומית בדיוק המקורי תצטרכו כרטיס מסך עם לפחות 16 גיגה-בייט זיכרון גרפי, כמו RTX 4080 או כרטיס תואם בענן. הקוד עצמו סטנדרטי לגמרי ונשען על ספריית transformers, תוך שימוש ב־AutoModelForCausalLM וטעינה אוטומטית לכרטיס עם device_map.

אם אין לכם כרטיס מתאים או שאתם לא מתכננים לכייל אותו בעצמכם על דאטה ייעודי, עדיף להשתמש ב־API מנוהל חיצוני. להקים שרת רק בשביל מודל בסיס בגודל כזה ידרוש תחזוקה שלא תמיד מצדיקה את עצמה ביחס לפניות בודדות.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/deepseek-math-7b-base")
print(pipe("שלום"))

הרישיון

הקוד בריפו מוגדר תחת רישיון MIT, אך משקלי המודל עצמם כפופים לרישיון מותאם אישית בשם Model License של החברה. הכרטיס מצהיר שהמודל תומך בשימוש מסחרי, אך לפני שילובו במוצר מחייב לקרוא את התנאים הספציפיים בקובץ הרישיון המקורי כדי לוודא שאין מגבלות הפצה נוספות.

הרישיון המלא בעמוד המודל ↗