GPT
A

Argimi-Ardian-Finance-10k-text

קוד פתוח

artefactorycc-by-4.02024-11-27

  • finance

מאגר של 34,000 דוחות כספיים שנתיים מפורקים לרמת עמודים, פסקאות ותאי טבלאות עם קואורדינטות. הוא פותר את הצורך בחילוץ מבנה מורכב ממסמכי PDF פיננסיים באנגלית.

  • 17,899הורדות בחודש
  • 19לייקים

מה זה

המאגר מכיל 34,000 דוחות שנתיים באנגלית שפורסמו מסוף שנות התשעים ועד שנת 2023. הנתונים המקוריים נאספו על ידי חברת ההשקעות Ardian מתוך מסמכים ציבוריים, ועברו עיבוד של חברת Artefact במסגרת פרויקט המחקר ArGiMi.

כל קובץ PDF חולק לעמודים בודדים שעובדו בעזרת ספריית docling. עבור כל עמוד חילצו את הטקסט המלא, לצד פירוק לשני מבנים מרכזיים. המבנה הראשון כולל מקטעים מסומנים עם תוויות כמו כותרת, פסקה או טבלה, כולל קואורדינטות מיקום בעמוד. המבנה השני מתמקד בטבלאות ומפרק אותן לתאים בודדים עם מזהה, טקסט, מיקום, ובמקרים של זיהוי תווים אופטי גם ציון רמת דיוק. החילוץ בוצע עם EasyOCR וכלל התאמת מבנה טבלאות מדויק, כשהמסמכים עצמם מזוהים לפי גיבוב של התוכן שלהם.

מתאים ל

  • אימון מודלי שליפת מידע

    פיתוח מערכות RAG שמסוגלות לאתר נתונים כספיים מדויקים בתוך טבלאות ופסקאות של דוחות שנתיים.

  • ניתוח והבנת מסמכים

    אימון מודלים לזיהוי מבנה עמוד פיננסי והבנת הקשר בין כותרות, טבלאות ומקטעי טקסט.

  • יצירת טקסט פיננסי

    כוונון מודלי שפה לכתיבה, תמצות וניתוח של שפה עסקית ודוחות רווח והפסד באנגלית.

איפה זה נופל

המאגר מוגבל לאנגלית בלבד, ואינו כולל נתונים בעברית או התייחסות לחברות ורגולציה מקומית. הנתונים מגיעים עד שנת 2023, כך שאין בו מידע פיננסי עדכני מהתקופה האחרונה. מעבר לכך, מדובר בגרסת טקסט בלבד ללא תמונות העמודים המקוריות, ואיכות הנתונים תלויה לחלוטין ברמת הדיוק של הצינור האוטומטי ושל מנוע ה־OCR. היוצרים עצמם מבהירים שהנתונים מיועדים למחקר, מסירים כל אחריות לגבי דיוק או שלמות החומר, וממליצים לא להסתמך עליהם ישירות לחישובים פיננסיים קריטיים בלי אימות.

שאלות
נפוצות

האם המאגר מתאים לשימוש בפרויקט מסחרי?

כן, הרישיון של המאגר הוא CC BY 4.0 שמתיר שימוש מסחרי מלא. התנאי היחיד הוא מתן קרדיט מפורש ליוצרי המאגר על פי תנאי הרישיון. עם זאת, היוצרים מציינים שהנתונים נמסרו כפי שהם וללא אחריות לדיוק המידע הפיננסי.

האם יש במאגר דוחות בעברית או של חברות ישראליות?

המאגר כולל אך ורק דוחות שנתיים באנגלית. הוא לא מכיל מסמכים בעברית ואינו מיועד להתמודדות עם רגולציה או דיווחים מקומיים של הבורסה בתל אביב. אם אתם צריכים לאמן מודל על מסמכים מקומיים, תצטרכו לאסוף אותם בנפרד.

מה שונה בגרסה הזו לעומת גרסאות אחרות של הפרויקט?

זו גרסה קלה יותר שכוללת רק את הטקסט המופק, המבנה והקואורדינטות. היא אינה כוללת את תמונות העמודים המקוריות של קובצי ה־PDF. מי שזקוק לתמונות עצמן לצורך אימון מודלי ראייה ממוחשבת צריך להשתמש בגרסת text-image הנפרדת.

איך מחולצים הנתונים והטבלאות בתוך הדוחות?

החילוץ התבצע באופן אוטומטי לחלוטין באמצעות ספריית docling ומנוע EasyOCR על גבי מעבדים גרפיים. התהליך כלל זיהוי של גבולות תאים והתאמת מבנה טבלאות במצב ייעודי. לכל תא ומקטע מוצמדות קואורדינטות מיקום מדויקות בתוך העמוד.

איך טוענים

טוענים את המאגר ישירות מחיבוק פנים באמצעות load_dataset עם השם artefactory/Argimi-Ardian-Finance-10k-text עבור הפיצול train. הגישה פתוחה לחלוטין ואין צורך באישור מיוחד. המאגר מורכב מ־33,442 קבצי ארכיון דחוסים, לכן מומלץ להשתמש באפשרות streaming בזמן הטעינה כדי לא להעמיס על זיכרון העבודה והאחסון המקומי. השדות המרכזיים לעבודה הם תוכן הטקסט הגולמי של כל עמוד, רשימת המקטעים עם סוג התוכן והמיקום, ומבנה התאים בטבלאות.

from datasets import load_dataset

ds = load_dataset("artefactory/Argimi-Ardian-Finance-10k-text")

הרישיון

המאגר מופץ תחת רישיון CC BY 4.0. הרישיון מאפשר שימוש מסחרי, מחקרי, שינוי ושיתוף של הנתונים, ואינו מחייב שחרור של מודלים או פיתוחים נגזרים תחת אותו רישיון. התנאי המרכזי הוא מתן קרדיט וייחוס הולם ליוצרים לפי דרישות הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗