דילוג לתוכן
  • דף הבית
  • קטגוריות
  • פוסטים אחרונים
  • משתמשים
  • חיפוש
  • חוקי הפורום
כיווץ
תחומים

תחומים - פורום חרדי מקצועי

💡 רוצה לזכור קריאת שמע בזמן? לחץ כאן!
  1. דף הבית
  2. תוכנה
  3. בירור בירור מספר דברים בשיטת zstd

בירור בירור מספר דברים בשיטת zstd

מתוזמן נעוץ נעול הועבר תוכנה
33 פוסטים 6 כותבים 387 צפיות 5 עוקבים
  • מהישן לחדש
  • מהחדש לישן
  • הכי הרבה הצבעות
תגובה
  • תגובה כנושא
התחברו כדי לפרסם תגובה
נושא זה נמחק. רק משתמשים עם הרשאות מתאימות יוכלו לצפות בו.
  • dovidD dovid

    יש פה בעיית תקשורת, אני כל הזמן בהבנה שמה שדחוס זה סטטי ולא משתנה,
    והאינדקס נוצר בכלל אצל המפיץ או הכי גרוע אצל המשתמש לפני בכלל שהחומר מוכנס לדחיסה.
    אולי תרחיבו לי מה המידע הרבה שדחוס ומאונדקס?
    לא מדובר בספרי קודש של הבית היהודי?
    אם ככה אז האינדקוס יכול בכלל להתבצע בבית המפיץ פעם אחת ולתמיד.
    גם אם המשתמש מוסיף אי אלו טקסטים משלו, אז: יוצרים שורות בלתי דחוסות, מאנדקסים, דוחסים, שלום על ישראל.
    אני מפספס משהו?

    י.פל.י מנותק
    י.פל.י מנותק
    י.פל.
    כתב נערך לאחרונה על ידי י.פל.
    #24

    @dovid כתב בבירור בירור מספר דברים בשיטת zstd:

    אם ככה אז האינדקוס יכול בכלל להתבצע בבית המפיץ פעם אחת ולתמיד.

    נכון - כך באמת יהיה בעז"ה מהגרסה הבאה.
    ועדיין, אני מכיר את המשתמשים 🙂 המון ימשיכו את האינדקס כפי שהיה עד היום.
    אל תשאל למה: גם אני לא יודע... (בשעתו הייתה אפשרות לחיפוש ללא אינדקס, ועד שהסרנו אותה עוד היו שהשתמשו בה, ושאלו למה אין שם עוד אופציות, כפי שהוספנו בחיפוש עם האינדקס).
    עריכה: מצד שני, כפי שכתב לי אחד התורמים, שליפת הטקסט עצמו מהדיסק קטנה וזולה יותר - אולי זה מאפס את הפיענוח.

    תגובה 1 תגובה אחרונה
    0
    • dovidD מחובר
      dovidD מחובר
      dovid
      ניהול
      כתב נערך לאחרונה על ידי dovid
      #25

      הפיענוח לא לוקח כמעט כלום בלי קשר לחיסכון שיש או אין בקריאה... לא צריך לקזז את ההקטנה של הקלט.
      תבקש מהAI לכתוב לך טסט קטן, לבדוק כמה זמן מדובר.

      • מנטור אישי בתכנות והמסתעף – להתקדם לשלב הבא!
      • בכל נושא אפשר ליצור קשר dovid@tchumim.com
      pcinfogmachP תגובה 1 תגובה אחרונה
      1
      • dovidD dovid

        הפיענוח לא לוקח כמעט כלום בלי קשר לחיסכון שיש או אין בקריאה... לא צריך לקזז את ההקטנה של הקלט.
        תבקש מהAI לכתוב לך טסט קטן, לבדוק כמה זמן מדובר.

        pcinfogmachP מנותק
        pcinfogmachP מנותק
        pcinfogmach
        כתב נערך לאחרונה על ידי pcinfogmach
        #26

        @dovid @yossiz
        הועלתה הצעה להשתמש עם דחיסה של zipvfs שזה בעצם דוחס את page blocks של המסד עצמו
        האם זה עדיף על ההצעה הנוכחית של דחיסת הטקסט בלבד על ידי dictionary?

        גמ"ח מידע מחשבים ואופיס

        yossizY תגובה 1 תגובה אחרונה
        0
        • pcinfogmachP pcinfogmach

          @dovid @yossiz
          הועלתה הצעה להשתמש עם דחיסה של zipvfs שזה בעצם דוחס את page blocks של המסד עצמו
          האם זה עדיף על ההצעה הנוכחית של דחיסת הטקסט בלבד על ידי dictionary?

          yossizY מנותק
          yossizY מנותק
          yossiz
          כתב נערך לאחרונה על ידי
          #27

          @pcinfogmach
          א. זה לא חינמי, זה עולה $4,000 אם הבנתי נכון
          ב. אין לזה יתרון עבורך, הדחיסה תהיה פחות טובה

          📧 יוסי@מייל.קום | 🌎 בלוג | ☕ קפה
          👈 רוצים כתובת מייל בעברית? כנסו למייל.קום 👉

          תגובה 1 תגובה אחרונה
          0
          • yossizY מנותק
            yossizY מנותק
            yossiz
            כתב נערך לאחרונה על ידי
            #28

            @pcinfogmach אם אתם רוצים דחיסה יותר טובה, כדאי לבדוק אפשרות לשמור בלוקים של כמה שורות טקסט, (מאתיים שורות לבלוק למשל) פר שורה ב-DB, ובנוסף אינדקס שמצביע על ה-offset של כל שורה, כדי שתוכלו עדיין לגשת לטקסט ברמת שורה, זה ישפר את רמת הדחיסה. אני לא יודע בכמה. בלי מילון מותאם אישית זה יהיה הבדל משמעותי, עם מילון זה פחות חשוב אבל עדיין יעזור.
            המחיר של פיענוח 200 שורות פר שליפה לעומת שורה אחת אמור להיות זניח

            📧 יוסי@מייל.קום | 🌎 בלוג | ☕ קפה
            👈 רוצים כתובת מייל בעברית? כנסו למייל.קום 👉

            תגובה 1 תגובה אחרונה
            0
            • dovidD מחובר
              dovidD מחובר
              dovid
              ניהול
              כתב נערך לאחרונה על ידי
              #29

              הדחיסה של ZSTD היא מעולה פה, ומאוד אפקטיבית.
              ספרי קודש מכילים כ35 תווים בלבד באומדן פרוע, והמון רצפים קבועים,
              לא חושב שצריך לחפש משהו אחר.

              • מנטור אישי בתכנות והמסתעף – להתקדם לשלב הבא!
              • בכל נושא אפשר ליצור קשר dovid@tchumim.com
              תגובה 1 תגובה אחרונה
              1
              • pcinfogmachP מנותק
                pcinfogmachP מנותק
                pcinfogmach
                כתב נערך לאחרונה על ידי pcinfogmach
                #30

                @dovid @yossiz
                מחילה לא הסברתי את עצמי מספיק
                בתחילה הוצע לדחוס רק את עמודת הטקסט עם zstd
                כעת השאלה היא האם יש דרך יעילה אולי לדחוס את שאר המטה דאטה
                הנתונים שתכבתי בתחליה התבררו שהיו על DB ישן בDB הנוכחי שנתונים הנלווים לטקטס מהווים בערך מחצית מהמשקל של הDB
                הנתונים הם עירבוביא חלקם טקסט וחלקם מספריים
                גם ישנם הרבה עמודות שמאונדקסות לצורך lookup מהיר ויש הרבה שימוש בפעולות join על המטה דאטה

                לכן השאלה שלנו היא:
                האם כדאי ליישם דחיסה גם על שאר הנתונים
                ובאיזו שיטה
                בראש שלי זה שאלה של פשטות בקוד וגם שאלה של יעילות
                כלומר אם זה יאט את שליפת הנתונים בצורה משמעותית אזי אין הצר שווה בנזק המלך
                וכמו"כ אם זה יכניס קושי כלשהו בניהול הנתונים המסד (שמתעדכן ומשתנה כל הזמן) זה גם לא שווה את הרווח של דחיסה.
                היישום של דחיסת עמודת הטקסט אני בטוח בעצמי בפרט לאור התשובה שלכם שזה יישום קל ופשוט ואין שום סיבה לא ללכת על זה
                על שאר הנתונים אינני יודע
                אשמח לקבל קצה חוט איך להחליט כזה דבר
                ובאם השאלה עדיין לא ברורה דיו או שיש צורך לפרט יותר על מבנה המסד אנא כתבו על כך

                גמ"ח מידע מחשבים ואופיס

                תגובה 1 תגובה אחרונה
                0
                • dovidD מחובר
                  dovidD מחובר
                  dovid
                  ניהול
                  כתב נערך לאחרונה על ידי
                  #31

                  @pcinfogmach

                  1. מתי ואיך המטה דטה נשלף, האם בדיוק באותו קצב וזמן של הדטה עצמו?
                  2. מה המידע שיש במטה דטה, אולי זה בר דחיסה אפליקטיבית, למשל במקום שימוש בטקסט חופשי שימוש במבנה או מלא רעיונות דומים.
                  • מנטור אישי בתכנות והמסתעף – להתקדם לשלב הבא!
                  • בכל נושא אפשר ליצור קשר dovid@tchumim.com
                  pcinfogmachP תגובה 1 תגובה אחרונה
                  1
                  • dovidD dovid

                    @pcinfogmach

                    1. מתי ואיך המטה דטה נשלף, האם בדיוק באותו קצב וזמן של הדטה עצמו?
                    2. מה המידע שיש במטה דטה, אולי זה בר דחיסה אפליקטיבית, למשל במקום שימוש בטקסט חופשי שימוש במבנה או מלא רעיונות דומים.
                    pcinfogmachP מנותק
                    pcinfogmachP מנותק
                    pcinfogmach
                    כתב נערך לאחרונה על ידי
                    #32

                    @dovid

                    אנסה לענות בקצרה, ואם זה עדיין לא יהיה מספיק ברור, אולי כדאי שפשוט נדבר בפרטי, אם זה אפשרי. (אין לי אפשרות לשלם לך, אז אולי זה לא לגמרי הוגן לבקש דבר כזה. מאידך, אוצריא היא תוכנה שכמעט כל אברך שני משתמש בה כיום, אז אולי יש לי כאן קצת "מיגו דהעזה" לבקש ממך זאת...)

                    לגבי המטא־דאטה:
                    הרבה מהמטא־דאטה מורכב מקישורים.
                    סוגי הקישורים העיקריים הם:

                    1. קישורים ממפרשים לטקסט.
                    2. קישורי מראי מקומות לספר שממנו הם נלקחו (למשל: בראשית א, א).

                    שני סוגי הקישורים הללו נמצאים בטבלאות נפרדות ומקושרים באמצעות ID.
                    מלבד זאת, לכל אחד מהם יש מטא־דאטה נלווה רב, שמטרתו לייעל תהליכים שונים. לדוגמה, לצורך הצגת המפרשים יש מידע נוסף על כותרות, מבנה, ועוד פרטים רבים.

                    בנוסף, קיימת מטא־דאטה גם בטבלת הטקסט עצמה, כגון מידע המסייע לעדכונים ולפעולות נוספות.

                    בקיצור, מדובר בפרויקט שלם ומורכב, ולכן אשמח אם תוכל לכוון אותי מעט יותר ולפרט אילו נתונים בדיוק חשוב לך לדעת.
                    מצורף פה קובץ מתוך הפרוייקט שלי שהוא פרוייקט מקביל שכולל את רוב הSQL שהתוכנה משתמשת בו אולי זה יהיה שימושי
                    queries.sql.ts
                    מצורף גם הסכמה של הDB
                    seforimdb-v2-schema.json

                    לגבי המושגים עליהם דיברת ב-2 איך אומרים באנגלית? "Way over my head"... לצערי אינני מכיר כלל את המושגים שעליהם דיברת. אם זה חשוב שאלמד עליהם אנא ציין זאת ואקיים בעצמי "צא ולמד"

                    גמ"ח מידע מחשבים ואופיס

                    תגובה 1 תגובה אחרונה
                    1
                    • dovidD מחובר
                      dovidD מחובר
                      dovid
                      ניהול
                      כתב נערך לאחרונה על ידי
                      #33

                      אחרי שיחה עם @pcinfogmach משתף שהמטה-דטה זה כמה טבלאות, שכל כולם מספרים, למשל מספר ספר מספר שורה מיקום בטקסט, מזהה, וטבלה שמשקרת את זה לX ולY והכל עם מספרים. על כל זה יש אינדקסים שזה בעצם הרבה טבלאות נסתרות.
                      לכאורה אין לזה פתרון מלבד מעבר על האינדקסים מה נצרך ומה לא, ואולי גם פיצול הטבלאות בשביל לחסוך שורות בהם יש הרבה עמודות ריקות על פני שורות רבות (רק אם זה משמעותי, אחרת יצא שכרו בהפסדים אחרים).

                      • מנטור אישי בתכנות והמסתעף – להתקדם לשלב הבא!
                      • בכל נושא אפשר ליצור קשר dovid@tchumim.com
                      תגובה 1 תגובה אחרונה
                      1
                      תגובה
                      • תגובה כנושא
                      התחברו כדי לפרסם תגובה
                      • מהישן לחדש
                      • מהחדש לישן
                      • הכי הרבה הצבעות


                      • 1
                      • 2
                      בא תתחבר לדף היומי!
                      • התחברות

                      • אין לך חשבון עדיין? הרשמה

                      • התחברו או הירשמו כדי לחפש.
                      • פוסט ראשון
                        פוסט אחרון
                      0
                      • דף הבית
                      • קטגוריות
                      • פוסטים אחרונים
                      • משתמשים
                      • חיפוש
                      • חוקי הפורום