GPT
T

Turkish-Finance-SFT-Dataset

קוד פתוח

AlicanKiraz0mit2026-02-12

  • finance
  • fintech

מאגר שאלות ותשובות בטורקית שמיועד לאימון מודלים סביב שוק ההון, מטבעות קריפטוגרפיים ורגולציה. החומר מקיף מושגים מקומיים ובינלאומיים בפורמט הוראות מוכן לשימוש.

  • 118הורדות בחודש
  • 63לייקים

מה זה

הנתונים מגיעים כצמדי שאלות ותשובות שמחולקים לשדות הוראה, קלט ופלט. התוכן מכסה שישה תחומים עיקריים שכוללים את עולם הקריפטו, בורסות בטורקיה ובעולם, ניתוח טכני, ניתוח פונדמנטלי, ניהול סיכונים ורגולציה פיננסית. הכרטיס מפרט תת נושאים רבים, מאינדיקטורים של מסחר ועד חוקי מיסוי ורשויות פיקוח בארצות הברית ובאירופה.

תיעוד המאגר לא מסביר מהיכן הטקסטים נאספו, האם נכתבו בידי מומחים, נלקחו מאתרים קיימים או יוצרו באמצעות מודל שפה. אין פירוט לגבי שלבי סינון או בדיקות איכות שנעשו על המידע לפני פרסומו. המאגר מכיל קובץ בשם finance_sft_dataset.jsonl ומחזיק כמות טוקנים כוללת של כעשרה מיליון.

מתאים ל

  • אימון עוזר פיננסי

    כוונון מודלי שפה לענייני מסחר ומניות בטורקית בפורמט הוראות מוכן.

  • שליפת מידע במערכות RAG

    שימוש ברשומות כמאגר ידע פיננסי לשליפת תשובות על מושגי מסחר וקריפטו.

  • מחקר והערכת מודלים

    בדיקת יכולת המענה של מודלים קיימים על שאלות בתחום הכלכלה בטורקית.

איפה זה נופל

החיסרון המרכזי כאן הוא חוסר שקיפות מוחלט לגבי מקור המידע ותהליך הסינון שלו. נתונים פיננסיים דורשים דיוק מוחלט, והיוצר עצמו מצהיר שהמאגר אינו מהווה ייעוץ השקעות ואינו מבטיח עדכניות של תנאי השוק. בנוסף, כל המלל כתוב בטורקית בלבד. הקורא הישראלי לא ימצא כאן עברית או התייחסות לחוקים ולשוק המקומי, ויש סתירה פנימית בתיעוד לגבי נפח השורות מול המטא דאטה.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

כן, הרישיון המדווח הוא MIT ובתגית מופיע Apache 2.0. שני הרישיונות מתירים שימוש מסחרי ללא תמלוגים, בתנאי שמצרפים את הקרדיט והרישיון המקורי.

האם יש במאגר נתונים בעברית?

לא. המאגר מוגדר וכתוב כולו בטורקית, ומכסה מושגים בינלאומיים יחד עם התמקדות בשוק ההון והרגולציה של טורקיה.

איך אספו ויצרו את השאלות והתשובות?

הכרטיס לא מפרט את מקור המידע. לא ידוע אם הנתונים נגרדו מהרשת, נכתבו על ידי מומחי מסחר או הופקו בצורה סינתטית באמצעות מודל אחר.

מה גודל המאגר בפועל?

המטא דאטה באתר מציין טווח שבין אלף לעשרת אלפים רשומות, בעוד הטבלה בתיעוד מציינת עשרה מיליון שורות, וכמות הטוקנים מוערכת בכעשרה מיליון. הקובץ המרכזי ששמור במאגר הוא קובץ jsonl יחיד.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות המזהה AlicanKiraz0/Turkish-Finance-SFT-Dataset. אין צורך באישור גישה מראש כדי להוריד את הקבצים. המבנה מבוסס על קובץ JSONL פשוט שבו כל שורה מחזיקה מפתחות של instruction, input ו־output, כך שאפשר להזין אותו ישירות לתהליכי כוונון עדין סטנדרטיים.

from datasets import load_dataset

ds = load_dataset("AlicanKiraz0/Turkish-Finance-SFT-Dataset")

הרישיון

הרישיון המדווח במטא דאטה ובטקסט הוא MIT, למרות שבתגית הפתיחה מופיע סמל של Apache 2.0. שניהם רישיונות פתוחים ומתירניים שמאפשרים שימוש מסחרי מלא, שינוי והפצה, כל עוד שומרים על הודעת זכויות היוצרים המקורית. מודל שתאמנו על הבסיס הזה לא נדרש לחשוף את המשקולות או לשתף את התוצר תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗