דילוג לתוכן
  • דף הבית
  • קטגוריות
  • פוסטים אחרונים
  • משתמשים
  • חיפוש
  • חוקי הפורום
כיווץ
תחומים

תחומים - פורום חרדי מקצועי

💡 רוצה לזכור קריאת שמע בזמן? לחץ כאן!
  1. דף הבית
  2. תוכנה
  3. בירור בירור מספר דברים בשיטת zstd

הפורום כעת לקריאה בלבד, לקריאה נוספת.

בירור בירור מספר דברים בשיטת zstd

מתוזמן נעוץ נעול הועבר תוכנה
33 פוסטים 6 כותבים 1.0k צפיות 5 עוקבים
  • מהישן לחדש
  • מהחדש לישן
  • הכי הרבה הצבעות
תגובה
  • תגובה כנושא
התחברו כדי לפרסם תגובה
נושא זה נמחק. רק משתמשים עם הרשאות מתאימות יוכלו לצפות בו.
  • dovidD dovid

    @yossiz כתב בבירור בירור מספר דברים בשיטת zstd:

    אין לי מושג אם זה באמת יארוך 3 ימים...

    זה היה מליצה, או מחשב פצצה וזה לוקח שניה, או 286 IBM ושלוש ימים (כנראה פחות)...

    אני לא מבין איך אתה מסכים שהם יעשו חיפוש על שורות דחוסות!
    @pcinfogmach היום החיפוש עובד עם LIKE של SQLLITE??

    בקשר לאימון כפי שאמרתי זה היה בדיחה, זה תהליך חד פעמי של דקות בודדות, בזמן פיתוח.
    בקשר לעלות הפרישה (פתיחה מדחיסה) כפי שאומר @yossiz זה כלום כלום, כל עוד אנחנו לא מדברים על חיפוש.

    yossizY
    yossizY
    yossiz
    כתב ב נערך לאחרונה על ידי yossiz
    #19

    @dovid האינדקס מאוחסן בנפרד. הדחיסה רק על הטקסט המלא של הספר
    כתבו שהם משתמשים בTantivy

    📧 יוסי@מייל.קום | 🌎 בלוג | ☕ קפה
    👈 רוצים כתובת מייל בעברית? כנסו למייל.קום 👉

    תגובה 1 תגובה אחרונה
    2
    • dovidD dovid

      @yossiz כתב בבירור בירור מספר דברים בשיטת zstd:

      אין לי מושג אם זה באמת יארוך 3 ימים...

      זה היה מליצה, או מחשב פצצה וזה לוקח שניה, או 286 IBM ושלוש ימים (כנראה פחות)...

      אני לא מבין איך אתה מסכים שהם יעשו חיפוש על שורות דחוסות!
      @pcinfogmach היום החיפוש עובד עם LIKE של SQLLITE??

      בקשר לאימון כפי שאמרתי זה היה בדיחה, זה תהליך חד פעמי של דקות בודדות, בזמן פיתוח.
      בקשר לעלות הפרישה (פתיחה מדחיסה) כפי שאומר @yossiz זה כלום כלום, כל עוד אנחנו לא מדברים על חיפוש.

      pcinfogmachP
      pcinfogmachP
      pcinfogmach
      כתב ב נערך לאחרונה על ידי pcinfogmach
      #20

      @dovid כתב בבירור בירור מספר דברים בשיטת zstd:

      @pcinfogmach היום החיפוש עובד עם LIKE של SQLLITE??

      כמו ש @yossiz ציין החיפוש נעשה על ידי מנוע חיפוש tantivy.
      השימוש בDB בעת החיפוש נעשה לאחר שמנוע החיפוש החזיר את התוצאות וכדי להציג גזירים עבור תוצאות החיפוש.

      גמ"ח מידע מחשבים ואופיס

      תגובה 1 תגובה אחרונה
      1
      • dovidD
        dovidD
        dovid
        ניהול
        כתב ב נערך לאחרונה על ידי
        #21

        מעולה, אז כל ההתייעצות היא מפחד שגוי.
        פתיחה של טקסטים באורך כזה, זה לחם חוקו של המחשב.
        בכל דפדוף באינטרנט יש מאות פעולות יקרות בהרבה.
        לא צריך מקביליות ולא צריך שום טריק להרוויח ביצועים.

        • מנטור אישי בתכנות והמסתעף – להתקדם לשלב הבא!
        • בכל נושא אפשר ליצור קשר dovid@tchumim.com
        י.פל.י תגובה 1 תגובה אחרונה
        2
        • dovidD dovid

          מעולה, אז כל ההתייעצות היא מפחד שגוי.
          פתיחה של טקסטים באורך כזה, זה לחם חוקו של המחשב.
          בכל דפדוף באינטרנט יש מאות פעולות יקרות בהרבה.
          לא צריך מקביליות ולא צריך שום טריק להרוויח ביצועים.

          י.פל.י
          י.פל.י
          י.פל.
          כתב ב נערך לאחרונה על ידי
          #22

          @dovid כתב בבירור בירור מספר דברים בשיטת zstd:

          פתיחה של טקסטים באורך כזה, זה לחם חוקו של המחשב.

          והשליחה לאינדקס עצמו?
          כרגע אינדוקס לוקח דקות בודדות.
          לקורא ולפענח כמות כזו של חומר - זה גם נכלל ב"לחם חוקו"? כלומר - האם זה לא יאט את האינדוקס במידה ניכרת?
          תודה על המענה המפורט!

          תגובה 1 תגובה אחרונה
          0
          • dovidD
            dovidD
            dovid
            ניהול
            כתב ב נערך לאחרונה על ידי
            #23

            יש פה בעיית תקשורת, אני כל הזמן בהבנה שמה שדחוס זה סטטי ולא משתנה,
            והאינדקס נוצר בכלל אצל המפיץ או הכי גרוע אצל המשתמש לפני בכלל שהחומר מוכנס לדחיסה.
            אולי תרחיבו לי מה המידע הרבה שדחוס ומאונדקס?
            לא מדובר בספרי קודש של הבית היהודי?
            אם ככה אז האינדקוס יכול בכלל להתבצע בבית המפיץ פעם אחת ולתמיד.
            גם אם המשתמש מוסיף אי אלו טקסטים משלו, אז: יוצרים שורות בלתי דחוסות, מאנדקסים, דוחסים, שלום על ישראל.
            אני מפספס משהו?

            • מנטור אישי בתכנות והמסתעף – להתקדם לשלב הבא!
            • בכל נושא אפשר ליצור קשר dovid@tchumim.com
            י.פל.י תגובה 1 תגובה אחרונה
            1
            • dovidD dovid

              יש פה בעיית תקשורת, אני כל הזמן בהבנה שמה שדחוס זה סטטי ולא משתנה,
              והאינדקס נוצר בכלל אצל המפיץ או הכי גרוע אצל המשתמש לפני בכלל שהחומר מוכנס לדחיסה.
              אולי תרחיבו לי מה המידע הרבה שדחוס ומאונדקס?
              לא מדובר בספרי קודש של הבית היהודי?
              אם ככה אז האינדקוס יכול בכלל להתבצע בבית המפיץ פעם אחת ולתמיד.
              גם אם המשתמש מוסיף אי אלו טקסטים משלו, אז: יוצרים שורות בלתי דחוסות, מאנדקסים, דוחסים, שלום על ישראל.
              אני מפספס משהו?

              י.פל.י
              י.פל.י
              י.פל.
              כתב ב נערך לאחרונה על ידי י.פל.
              #24

              @dovid כתב בבירור בירור מספר דברים בשיטת zstd:

              אם ככה אז האינדקוס יכול בכלל להתבצע בבית המפיץ פעם אחת ולתמיד.

              נכון - כך באמת יהיה בעז"ה מהגרסה הבאה.
              ועדיין, אני מכיר את המשתמשים 🙂 המון ימשיכו את האינדקס כפי שהיה עד היום.
              אל תשאל למה: גם אני לא יודע... (בשעתו הייתה אפשרות לחיפוש ללא אינדקס, ועד שהסרנו אותה עוד היו שהשתמשו בה, ושאלו למה אין שם עוד אופציות, כפי שהוספנו בחיפוש עם האינדקס).
              עריכה: מצד שני, כפי שכתב לי אחד התורמים, שליפת הטקסט עצמו מהדיסק קטנה וזולה יותר - אולי זה מאפס את הפיענוח.

              תגובה 1 תגובה אחרונה
              0
              • dovidD
                dovidD
                dovid
                ניהול
                כתב ב נערך לאחרונה על ידי dovid
                #25

                הפיענוח לא לוקח כמעט כלום בלי קשר לחיסכון שיש או אין בקריאה... לא צריך לקזז את ההקטנה של הקלט.
                תבקש מהAI לכתוב לך טסט קטן, לבדוק כמה זמן מדובר.

                • מנטור אישי בתכנות והמסתעף – להתקדם לשלב הבא!
                • בכל נושא אפשר ליצור קשר dovid@tchumim.com
                pcinfogmachP תגובה 1 תגובה אחרונה
                1
                • dovidD dovid

                  הפיענוח לא לוקח כמעט כלום בלי קשר לחיסכון שיש או אין בקריאה... לא צריך לקזז את ההקטנה של הקלט.
                  תבקש מהAI לכתוב לך טסט קטן, לבדוק כמה זמן מדובר.

                  pcinfogmachP
                  pcinfogmachP
                  pcinfogmach
                  כתב ב נערך לאחרונה על ידי pcinfogmach
                  #26

                  @dovid @yossiz
                  הועלתה הצעה להשתמש עם דחיסה של zipvfs שזה בעצם דוחס את page blocks של המסד עצמו
                  האם זה עדיף על ההצעה הנוכחית של דחיסת הטקסט בלבד על ידי dictionary?

                  גמ"ח מידע מחשבים ואופיס

                  yossizY תגובה 1 תגובה אחרונה
                  0
                  • pcinfogmachP pcinfogmach

                    @dovid @yossiz
                    הועלתה הצעה להשתמש עם דחיסה של zipvfs שזה בעצם דוחס את page blocks של המסד עצמו
                    האם זה עדיף על ההצעה הנוכחית של דחיסת הטקסט בלבד על ידי dictionary?

                    yossizY
                    yossizY
                    yossiz
                    כתב ב נערך לאחרונה על ידי
                    #27

                    @pcinfogmach
                    א. זה לא חינמי, זה עולה $4,000 אם הבנתי נכון
                    ב. אין לזה יתרון עבורך, הדחיסה תהיה פחות טובה

                    📧 יוסי@מייל.קום | 🌎 בלוג | ☕ קפה
                    👈 רוצים כתובת מייל בעברית? כנסו למייל.קום 👉

                    תגובה 1 תגובה אחרונה
                    0
                    • yossizY
                      yossizY
                      yossiz
                      כתב ב נערך לאחרונה על ידי
                      #28

                      @pcinfogmach אם אתם רוצים דחיסה יותר טובה, כדאי לבדוק אפשרות לשמור בלוקים של כמה שורות טקסט, (מאתיים שורות לבלוק למשל) פר שורה ב-DB, ובנוסף אינדקס שמצביע על ה-offset של כל שורה, כדי שתוכלו עדיין לגשת לטקסט ברמת שורה, זה ישפר את רמת הדחיסה. אני לא יודע בכמה. בלי מילון מותאם אישית זה יהיה הבדל משמעותי, עם מילון זה פחות חשוב אבל עדיין יעזור.
                      המחיר של פיענוח 200 שורות פר שליפה לעומת שורה אחת אמור להיות זניח

                      📧 יוסי@מייל.קום | 🌎 בלוג | ☕ קפה
                      👈 רוצים כתובת מייל בעברית? כנסו למייל.קום 👉

                      תגובה 1 תגובה אחרונה
                      0
                      • dovidD
                        dovidD
                        dovid
                        ניהול
                        כתב ב נערך לאחרונה על ידי
                        #29

                        הדחיסה של ZSTD היא מעולה פה, ומאוד אפקטיבית.
                        ספרי קודש מכילים כ35 תווים בלבד באומדן פרוע, והמון רצפים קבועים,
                        לא חושב שצריך לחפש משהו אחר.

                        • מנטור אישי בתכנות והמסתעף – להתקדם לשלב הבא!
                        • בכל נושא אפשר ליצור קשר dovid@tchumim.com
                        תגובה 1 תגובה אחרונה
                        1
                        • pcinfogmachP
                          pcinfogmachP
                          pcinfogmach
                          כתב ב נערך לאחרונה על ידי pcinfogmach
                          #30

                          @dovid @yossiz
                          מחילה לא הסברתי את עצמי מספיק
                          בתחילה הוצע לדחוס רק את עמודת הטקסט עם zstd
                          כעת השאלה היא האם יש דרך יעילה אולי לדחוס את שאר המטה דאטה
                          הנתונים שתכבתי בתחליה התבררו שהיו על DB ישן בDB הנוכחי שנתונים הנלווים לטקטס מהווים בערך מחצית מהמשקל של הDB
                          הנתונים הם עירבוביא חלקם טקסט וחלקם מספריים
                          גם ישנם הרבה עמודות שמאונדקסות לצורך lookup מהיר ויש הרבה שימוש בפעולות join על המטה דאטה

                          לכן השאלה שלנו היא:
                          האם כדאי ליישם דחיסה גם על שאר הנתונים
                          ובאיזו שיטה
                          בראש שלי זה שאלה של פשטות בקוד וגם שאלה של יעילות
                          כלומר אם זה יאט את שליפת הנתונים בצורה משמעותית אזי אין הצר שווה בנזק המלך
                          וכמו"כ אם זה יכניס קושי כלשהו בניהול הנתונים המסד (שמתעדכן ומשתנה כל הזמן) זה גם לא שווה את הרווח של דחיסה.
                          היישום של דחיסת עמודת הטקסט אני בטוח בעצמי בפרט לאור התשובה שלכם שזה יישום קל ופשוט ואין שום סיבה לא ללכת על זה
                          על שאר הנתונים אינני יודע
                          אשמח לקבל קצה חוט איך להחליט כזה דבר
                          ובאם השאלה עדיין לא ברורה דיו או שיש צורך לפרט יותר על מבנה המסד אנא כתבו על כך

                          גמ"ח מידע מחשבים ואופיס

                          תגובה 1 תגובה אחרונה
                          0
                          • dovidD
                            dovidD
                            dovid
                            ניהול
                            כתב ב נערך לאחרונה על ידי
                            #31

                            @pcinfogmach

                            1. מתי ואיך המטה דטה נשלף, האם בדיוק באותו קצב וזמן של הדטה עצמו?
                            2. מה המידע שיש במטה דטה, אולי זה בר דחיסה אפליקטיבית, למשל במקום שימוש בטקסט חופשי שימוש במבנה או מלא רעיונות דומים.
                            • מנטור אישי בתכנות והמסתעף – להתקדם לשלב הבא!
                            • בכל נושא אפשר ליצור קשר dovid@tchumim.com
                            pcinfogmachP תגובה 1 תגובה אחרונה
                            1
                            • dovidD dovid

                              @pcinfogmach

                              1. מתי ואיך המטה דטה נשלף, האם בדיוק באותו קצב וזמן של הדטה עצמו?
                              2. מה המידע שיש במטה דטה, אולי זה בר דחיסה אפליקטיבית, למשל במקום שימוש בטקסט חופשי שימוש במבנה או מלא רעיונות דומים.
                              pcinfogmachP
                              pcinfogmachP
                              pcinfogmach
                              כתב ב נערך לאחרונה על ידי
                              #32

                              @dovid

                              אנסה לענות בקצרה, ואם זה עדיין לא יהיה מספיק ברור, אולי כדאי שפשוט נדבר בפרטי, אם זה אפשרי. (אין לי אפשרות לשלם לך, אז אולי זה לא לגמרי הוגן לבקש דבר כזה. מאידך, אוצריא היא תוכנה שכמעט כל אברך שני משתמש בה כיום, אז אולי יש לי כאן קצת "מיגו דהעזה" לבקש ממך זאת...)

                              לגבי המטא־דאטה:
                              הרבה מהמטא־דאטה מורכב מקישורים.
                              סוגי הקישורים העיקריים הם:

                              1. קישורים ממפרשים לטקסט.
                              2. קישורי מראי מקומות לספר שממנו הם נלקחו (למשל: בראשית א, א).

                              שני סוגי הקישורים הללו נמצאים בטבלאות נפרדות ומקושרים באמצעות ID.
                              מלבד זאת, לכל אחד מהם יש מטא־דאטה נלווה רב, שמטרתו לייעל תהליכים שונים. לדוגמה, לצורך הצגת המפרשים יש מידע נוסף על כותרות, מבנה, ועוד פרטים רבים.

                              בנוסף, קיימת מטא־דאטה גם בטבלת הטקסט עצמה, כגון מידע המסייע לעדכונים ולפעולות נוספות.

                              בקיצור, מדובר בפרויקט שלם ומורכב, ולכן אשמח אם תוכל לכוון אותי מעט יותר ולפרט אילו נתונים בדיוק חשוב לך לדעת.
                              מצורף פה קובץ מתוך הפרוייקט שלי שהוא פרוייקט מקביל שכולל את רוב הSQL שהתוכנה משתמשת בו אולי זה יהיה שימושי
                              queries.sql.ts
                              מצורף גם הסכמה של הDB
                              seforimdb-v2-schema.json

                              לגבי המושגים עליהם דיברת ב-2 איך אומרים באנגלית? "Way over my head"... לצערי אינני מכיר כלל את המושגים שעליהם דיברת. אם זה חשוב שאלמד עליהם אנא ציין זאת ואקיים בעצמי "צא ולמד"

                              גמ"ח מידע מחשבים ואופיס

                              תגובה 1 תגובה אחרונה
                              1
                              • dovidD
                                dovidD
                                dovid
                                ניהול
                                כתב ב נערך לאחרונה על ידי
                                #33

                                אחרי שיחה עם @pcinfogmach משתף שהמטה-דטה זה כמה טבלאות, שכל כולם מספרים, למשל מספר ספר מספר שורה מיקום בטקסט, מזהה, וטבלה שמשקרת את זה לX ולY והכל עם מספרים. על כל זה יש אינדקסים שזה בעצם הרבה טבלאות נסתרות.
                                לכאורה אין לזה פתרון מלבד מעבר על האינדקסים מה נצרך ומה לא, ואולי גם פיצול הטבלאות בשביל לחסוך שורות בהם יש הרבה עמודות ריקות על פני שורות רבות (רק אם זה משמעותי, אחרת יצא שכרו בהפסדים אחרים).

                                • מנטור אישי בתכנות והמסתעף – להתקדם לשלב הבא!
                                • בכל נושא אפשר ליצור קשר dovid@tchumim.com
                                תגובה 1 תגובה אחרונה
                                5

                                שלום! נראה שהשיחה הזו מעניינת אותך, אבל עדיין אין לך חשבון.

                                נמאס לכם לגלול בין אותם הפוסטים בכל ביקור? כשנרשמים לחשבון, תמיד תחזרו בדיוק למקום שבו הייתם קודם, ותוכלו לבחור לקבל התראות על תגובות חדשות (בין אם במייל, ובין אם בהתראת פוש). תוכלו גם לשמור סימניות ולפרגן ב-upvote לפוסטים כדי להביע הערכה לחברי קהילה אחרים.

                                בעזרת התרומה שלך, הפוסט הזה יכול להיות אפילו טוב יותר 💗

                                הרשמה התחברות
                                תגובה
                                • תגובה כנושא
                                התחברו כדי לפרסם תגובה
                                • מהישן לחדש
                                • מהחדש לישן
                                • הכי הרבה הצבעות


                                • 1
                                • 2
                                בא תתחבר לדף היומי!
                                • התחברות

                                • התחברו או הירשמו כדי לחפש.
                                • פוסט ראשון
                                  פוסט אחרון
                                0
                                • דף הבית
                                • קטגוריות
                                • פוסטים אחרונים
                                • משתמשים
                                • חיפוש
                                • חוקי הפורום