{"as_of":"2026-08-04T04:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9e46cc8979f116fc7ab095c8825f4394bb26b942d0375a9cbee86acd94664d39","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T03:56:49.260151Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T18:01:58.830209Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.24334","snapshot_observed_at":"2026-07-31T18:01:58.830209Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24332","last_updated":"2026-07-27T12:09:03Z","snapshot_observed_at":"2026-07-31T18:01:58.386264Z","submitted_at":"2026-07-27T12:09:03Z","title":"Cross-Attention Calibrated Deduplication for Retrieval-Augmented Generation System","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T18:01:58.830209Z"},"links":{"cited_paper":"/paper/2604.24334","citing_paper":"/paper/2607.24332"},"observation_digest":"sha256:53c404b5b5d2999fb19b59b591b552ec22c34ba5688bc0814de7ff2e9bb610c4","observation_id":"93496f4a-4c83-4546-bc98-236f84f9ee3d","resolution":{"observed_at":"2026-07-31T18:01:58.830209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.24334/citation-record","integrity":"/paper/2604.24334/integrity","json":"/paper/2604.24334/citation-record.json","paper":"/paper/2604.24334"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https : / / www","venue":null,"work_id":"c42d4dfa-e260-4376-94f7-ce33cf74aff7","year":2025},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:f70c50f857e43b72efd3e6062496d13fe0511007feccc49d7aef1c8b2dc82bb4","observation_id":"cc4fcaea-35e3-4889-b594-0d9c8f1af851","resolution":{"observed_at":"2026-05-26T21:28:22.864723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection","venue":null,"work_id":"fd6c65f2-cde0-449b-bde3-a905c0426b5e","year":2024},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:034a882c119b89799c25e3ffec1d91e3eff43e2fcb7fa1f0e42e52043ff07b13","observation_id":"ce0bebd5-d644-49c2-b63c-e1e20c800688","resolution":{"observed_at":"2026-05-26T21:28:22.893578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Latent dirichlet allocation","venue":null,"work_id":"c8ee83be-3f9a-44b5-9b01-0fb67364480a","year":2003},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:c48d388d0f7a7c115ecab6ac8598f253eb6262d47e6ab577738dde9bcc455138","observation_id":"4cd5a2b4-3581-40b1-88e8-31291e0ac286","resolution":{"observed_at":"2026-05-26T21:28:22.887290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-07-06T12:16:41.817858Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-07-11T00:47:43.172073Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:11752c9b2a80383205917a74d17711bbe3bef5f6f96ed297e00112ef3ed0eaf1","observation_id":"7d25e897-9d36-4f74-9943-908df51fb0c0","resolution":{"observed_at":"2026-05-17T12:55:41.994998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the resemblance and containment of documents","venue":null,"work_id":"9d7ce181-a20a-4ded-8e0e-6670c35c758c","year":1997},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:2300b776541029ce30e53d441453112d226cedce966b7adaee99de8a69b311c3","observation_id":"b20a6e91-1996-417d-8565-65ae950b9319","resolution":{"observed_at":"2026-05-26T21:28:22.889999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Identifying and filtering near-duplicate documents","venue":null,"work_id":"38c19335-52fd-48d7-8b25-5b9838bc4781","year":2000},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:3bdefc4890c8fce25d41249ad9236ec678971bf15324c205cff320252e3e3672","observation_id":"6be7762d-ccb1-4605-8209-7287d75558fe","resolution":{"observed_at":"2026-05-26T21:28:22.881745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03216","last_updated":"2025-12-12T11:26:32Z","snapshot_observed_at":"2026-07-06T17:25:35.493362Z","submitted_at":"2024-02-05T17:26:49Z","title":"M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation","version":5},"cited_work":{"arxiv_id":"2402.03216","doi":"10.48550/arxiv.2402.03216","metadata_source":"pith","pith_arxiv_id":"2402.03216","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation","venue":"cs.CL","work_id":"a9435752-4e49-42bd-95b4-0fec975633c8","year":2024},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2402.03216","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:c4e54f6f423553ec0146f7d573a74fdc198d1e1f3c626bff65fc0b717b53b55e","observation_id":"5ba8a442-3f5f-43be-8662-df87d84bf28f","resolution":{"observed_at":"2026-05-11T22:39:03.722424Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03849","last_updated":"2022-10-07T23:48:50Z","snapshot_observed_at":"2026-07-06T14:02:23.566635Z","submitted_at":"2022-10-07T23:48:50Z","title":"ConvFinQA: Exploring the Chain of Numerical Reasoning in Conversational Finance Question Answering","version":1},"cited_work":{"arxiv_id":"2210.03849","doi":"10.48550/arxiv.2210.03849","metadata_source":"arxiv_reference","pith_arxiv_id":"2210.03849","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"ConvFinQA: Exploring the chain of numerical reasoning in 20 conversational finance question answering","venue":null,"work_id":"36c74fad-5676-4ef0-bbc7-fb4f7022c0da","year":2022},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2210.03849","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:8581567e546a14af4ffcabc5a52972f30287834036a4dcd8dd8a96398c38958e","observation_id":"10e574d9-3ce3-4e00-a19a-445892a20c60","resolution":{"observed_at":"2026-05-09T00:14:28.150782Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"original-date: 2022-10-05T17:58:44Z","venue":null,"work_id":"59a1d8af-25a2-4203-acd1-e6384b9ce0a0","year":2022},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:a540f0fce56f6096562e864f48765ce7f29dd4d7063cd619d7dffbc16e61d236","observation_id":"40145df3-59a1-4c7a-a37f-021fc81ae235","resolution":{"observed_at":"2026-05-26T21:28:22.878683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":"2305.14233","doi":"10.48550/arxiv.2305.14233","metadata_source":"pith","pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","venue":"cs.CL","work_id":"5b264119-de53-49d1-b7be-d172bf51c834","year":2023},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:0e8b907b365f26b80c65f6a8e55b764bd1f513c034cd9c62f2c8f2e1bd7608b3","observation_id":"76a5cc8b-b925-4b06-a6d6-586e06a9c24c","resolution":{"observed_at":"2026-05-15T17:25:08.436185Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:27.379194+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:27.379194+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20936","last_updated":"2025-02-28T10:46:52Z","snapshot_observed_at":"2026-07-06T20:44:18.077927Z","submitted_at":"2025-02-28T10:46:52Z","title":"WebFAQ: A Multilingual Collection of Natural Q&A Datasets for Dense Retrieval","version":1},"cited_work":{"arxiv_id":"2502.20936","doi":"10.48550/arxiv.2502.20936","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20936","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv:2502.20936 [cs]","venue":null,"work_id":"93ce87c4-9ad8-433d-80c2-8f91520715d1","year":2024},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2502.20936","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:06b330a5fe0432045332bfa1afc364927d7056f017176db4933d79610f9b477b","observation_id":"4db77d1c-8d2c-4a0d-aac6-758f34577928","resolution":{"observed_at":"2026-05-09T00:14:28.063092Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.acl-long.99.url:","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Precise Zero-Shot Dense Retrieval without Relevance Labels","venue":null,"work_id":"bc6481d8-652d-42a1-8e81-5134671f1ba4","year":2023},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:df5aa6aa78e338de1c9528d4dd32779f66877170aea90645561f7edd1ac89c20","observation_id":"d7d2643d-5ae1-4d91-8668-905a3b79c5c0","resolution":{"observed_at":"2026-05-09T00:14:28.167176Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":"2312.10997","doi":"10.1186/1476-072x-8-72","metadata_source":"pith","pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","venue":"cs.CL","work_id":"b80d2790-6cd9-4c87-b3c4-de404f99a80e","year":2023},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:3b3cb3870b5a9a77a24df3ed0886000818f17e854f7f61a9ed178440a9ee0aad","observation_id":"272458cc-b7e2-4f5f-8455-263e294be037","resolution":{"observed_at":"2026-05-09T00:14:28.145332Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05794","last_updated":"2022-03-11T08:35:15Z","snapshot_observed_at":"2026-07-06T12:46:41.057346Z","submitted_at":"2022-03-11T08:35:15Z","title":"BERTopic: Neural topic modeling with a class-based TF-IDF procedure","version":1},"cited_work":{"arxiv_id":"2203.05794","doi":"10.1037/0003","metadata_source":"pith","pith_arxiv_id":"2203.05794","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"BERTopic: Neural topic modeling with a class-based TF-IDF procedure","venue":"cs.CL","work_id":"fe7000f5-9930-49ed-ba20-6975a338b713","year":2022},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2203.05794","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:6bc3991ffbee6a0427d8e276af0978d1f58feacf4058bb06482ccf1c70a3a7a6","observation_id":"5d7d6a41-21ef-4fe7-a258-b3adf716a04d","resolution":{"observed_at":"2026-05-11T21:51:33.648345Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08909","last_updated":"2020-02-10T18:40:59Z","snapshot_observed_at":"2026-08-02T17:52:27.326803Z","submitted_at":"2020-02-10T18:40:59Z","title":"REALM: Retrieval-Augmented Language Model Pre-Training","version":1},"cited_work":{"arxiv_id":"2002.08909","doi":"10.48550/arxiv.2002.08909","metadata_source":"pith","pith_arxiv_id":"2002.08909","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"REALM: Retrieval-Augmented Language Model Pre-Training","venue":"cs.CL","work_id":"a397ddf8-b0b7-4e32-9d59-fb6ea67ac287","year":2020},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2002.08909","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:df3b2a41c6c5c178f050fcc3e327c13fbc1dfb7cd1a6cab9e59f4f5c551bc7f9","observation_id":"730af53a-1eee-484b-9d96-151eada96ef2","resolution":{"observed_at":"2026-05-15T09:59:16.231557Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ed56a3a1-0295-41f8-8a1b-d8f3e9b4c8b4","year":null},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:500b3c3b7bd79e74d1ea81aabde50ff8b99dc5c5d6ec8e0ca86425c813bdcb55","observation_id":"793c7ae9-0a6e-4fd5-8981-0a72b4b757f5","resolution":{"observed_at":"2026-05-26T21:28:22.871515Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04701","last_updated":"2025-07-07T17:49:51Z","snapshot_observed_at":"2026-07-06T19:11:53.766902Z","submitted_at":"2024-09-07T03:54:46Z","title":"Late Chunking: Contextual Chunk Embeddings Using Long-Context Embedding Models","version":3},"cited_work":{"arxiv_id":"2409.04701","doi":"10.48550/arxiv.2409.04701","metadata_source":"pith","pith_arxiv_id":"2409.04701","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Late chunking: Contextual chunk embeddings using long-context embedding models","venue":"cs.CL","work_id":"e1da74cb-c1c9-4b5b-a16e-7d3cda276fc3","year":2024},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2409.04701","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:5c82a5e0738dea775d251759d1b4a4afdef2bac57092a88561879aabf0298c0c","observation_id":"c1551767-024f-4310-8e36-69cffa56c4ba","resolution":{"observed_at":"2026-05-11T21:51:33.688605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.1212303","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T13:16:57.966770Z","title":"author Montani, I","venue":"Zenodo (CERN European Organization for Nuclear Research)","work_id":"21f271e7-c123-4e13-856a-053f2da387a8","year":2020},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:5f559ade1df79103ea0806a21fa526757a05c8ee118c418c24ea9c7fc2dbc728","observation_id":"28ea42ca-97d6-4b8e-88d4-5bf01a324eea","resolution":{"observed_at":"2026-05-09T00:14:28.171140Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T15:08:47.996614+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T15:08:47.996614+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T15:08:47.996614+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.eacl-main.74","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:19:12.576674Z","title":"Leveraging Passage Retrieval with Generative Models for Open Domain Question Answering","venue":null,"work_id":"b7f86aa5-b9b1-42ad-b0cc-8d6f7ab85b04","year":2021},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:aff08c0d67ae8b13997a14a41145d9afbe3f4444010d0514246884bb0af44682","observation_id":"bae61d07-2286-4ae3-9ab2-8b939eb81a2a","resolution":{"observed_at":"2026-05-09T00:14:28.136380Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-30T14:55:32.844017+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-30T14:55:32.844017+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.04906","last_updated":"2020-09-30T21:27:13Z","snapshot_observed_at":"2026-07-06T09:11:26.109763Z","submitted_at":"2020-04-10T04:53:17Z","title":"Dense Passage Retrieval for Open-Domain Question Answering","version":3},"cited_work":{"arxiv_id":"2004.04906","doi":"10.48550/arxiv.2004.04906","metadata_source":"pith","pith_arxiv_id":"2004.04906","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Dense Passage Retrieval for Open-Domain Question Answering","venue":"cs.CL","work_id":"3d6f2008-b001-4542-ba3f-192f6880c74b","year":2020},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2004.04906","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:88101c494e785a6bc1ed7c416fe654ae0ad9de5f8f1fe7e64893309402184cb5","observation_id":"2f6cdeaa-b1aa-42cc-ae09-7b4fb6d06969","resolution":{"observed_at":"2026-05-15T21:24:42.733368Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.acl-long.577.url:","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deduplicating Training Data Makes Language Models Better","venue":null,"work_id":"049e8cd2-dea2-4cee-82da-0c6358bb886c","year":2022},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:33ce0e1cd638a28958b012bd605ecf26306905570fa7f93ea5234128a243d1f8","observation_id":"3f2e66ff-f9d3-4558-8622-ae98dc496755","resolution":{"observed_at":"2026-05-09T00:14:28.090922Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ullman.Mining of Massive Datasets","venue":null,"work_id":"2be79296-3ee2-49d9-9088-398ed48d222b","year":2020},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:b6e19eee6afd56a0dd4ade92bfff33be47c9d8de247dd7822654eb00f1b0f80b","observation_id":"3994e180-d176-4b78-a5cf-24838028c059","resolution":{"observed_at":"2026-05-26T21:28:22.897070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11401","last_updated":"2021-04-12T15:42:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-22T21:34:34Z","title":"Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks","version":4},"cited_work":{"arxiv_id":"2005.11401","doi":"10.1145/3626772.3657717","metadata_source":"pith","pith_arxiv_id":"2005.11401","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks","venue":"cs.CL","work_id":"27eaec54-c105-4969-8188-da5f0fca3688","year":2020},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2005.11401","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:a1cdbef3cd82c29834e3da9d2671e11a5a72069feebd09be8f98279c71bfef55","observation_id":"47188752-5c92-45b9-bea2-d69bc39d64d8","resolution":{"observed_at":"2026-05-10T20:41:58.301631Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":"1609.07843","doi":"10.1007/978-3-030-62077-6","metadata_source":"pith","pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Pointer Sentinel Mixture Models","venue":"cs.CL","work_id":"fef3833e-dc80-42a3-a1e0-ffbfafee6fff","year":2016},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:e6d7fe545b1f64b39285f88d1c2c919bc2856547e432e3310689ef738bdb4879","observation_id":"c21c33ae-9956-45b9-93e1-33b9ccccbdc7","resolution":{"observed_at":"2026-05-11T21:51:33.679466Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12837","last_updated":"2022-10-20T14:04:10Z","snapshot_observed_at":"2026-08-01T15:23:39.998892Z","submitted_at":"2022-02-25T17:25:19Z","title":"Rethinking the Role of Demonstrations: What Makes In-Context Learning Work?","version":2},"cited_work":{"arxiv_id":"2202.12837","doi":"10.48550/arxiv.2202.12837","metadata_source":"pith","pith_arxiv_id":"2202.12837","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Rethinking the Role of Demonstrations: What Makes In-Context Learning Work?","venue":"cs.CL","work_id":"d2b537df-825d-4427-9575-fc0664c0962a","year":2022},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2202.12837","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:6f334bbc1d5425370284011a823bca5e691ca1e68491446bb58a170608bd6c48","observation_id":"92b3a032-107f-4028-a845-66d0504c2fe4","resolution":{"observed_at":"2026-05-15T09:51:47.316034Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-21T18:22:50.486187+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T18:22:50.486187+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"48ec9e82-aaab-445a-9935-dc932ae7d481","year":2023},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:deffec0b9b0eca45efbab104c82fd1c0b133f05ff17c62c0656a29226b9df561","observation_id":"f7b58db5-6f3b-48ca-8af1-997509c250ba","resolution":{"observed_at":"2026-05-26T21:28:22.900616Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"June 2021.URL: https : / / huggingface","venue":null,"work_id":"6dddd8af-9d84-4cc0-af8c-0bd08addfbd5","year":2021},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:84581dbaaf5a8c5d4dbe7e2834a5823708ec4299adca69f456dec0d4299e0cf7","observation_id":"3b7b0a0b-1ac8-4e9b-b59c-c4690a7b66f6","resolution":{"observed_at":"2026-05-26T21:28:22.868612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":"1908.10084","doi":"10.48550/arxiv.1908.10084","metadata_source":"pith","pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-07-10T20:57:34.817516Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","venue":"cs.CL","work_id":"27adfcc9-2a67-43d6-a844-78309012411f","year":2019},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:70b174f144f566697fea10a42392572ff38075c18fa8da8bb0cae08d4ba407d1","observation_id":"84e6e3cb-cfa3-4355-a40b-24763ad83690","resolution":{"observed_at":"2026-05-10T14:54:09.090339Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-12T06:19:15.148899+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T06:19:15.148899+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.10276","doi":"10.48550/arxiv.2510.10276","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Lost in the middle: An emergent property from information retrieval demands in LLMs","venue":null,"work_id":"55be2a17-4c66-4a7e-a242-a7fc4c579c96","year":2025},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:3ac5405e8ed2739b2a16317b4b004c02cb2beaeded790271e4517cd116cabffa","observation_id":"49f505c4-764e-4c9b-95d9-357e99fbcc63","resolution":{"observed_at":"2026-05-09T00:14:28.128955Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18059","last_updated":"2024-01-31T18:30:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-31T18:30:21Z","title":"RAPTOR: Recursive Abstractive Processing for Tree-Organized Retrieval","version":1},"cited_work":{"arxiv_id":"2401.18059","doi":"10.48550/arxiv.2401.18059","metadata_source":"pith","pith_arxiv_id":"2401.18059","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"RAPTOR: Recursive Abstractive Processing for Tree-Organized Retrieval","venue":"cs.CL","work_id":"e941569c-fee0-4d1f-bfe0-7e888d152264","year":2024},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2401.18059","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:76b227b1aea5b059022599a1bd57bff4a5f103bb5f300e1aff18c00608d25187","observation_id":"30cac83d-b86c-4697-a24b-0cc0189587f9","resolution":{"observed_at":"2026-05-15T13:07:16.607810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"en-US.URL: https://bidenwhitehouse.archives.gov/state-of-the-union- 2024/(visited on 12/17/2025)","venue":null,"work_id":"fc6463da-13a3-4ee8-a201-b71ed9281bdd","year":2024},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:7ce3878d47f8a8d0f7bddbccef4ab1636f1f805f423323fc050a1b402c68a549","observation_id":"625311e8-c691-476e-a5f7-32a7d1917661","resolution":{"observed_at":"2026-05-26T21:28:22.875069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text Retrieval","venue":null,"work_id":"693393e3-7adb-41a4-a639-2c0b82936a93","year":2021},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:d38d9228ef1d2451f9a3f12746b12b865d6b14d5da45f495f3e68ed19abe244e","observation_id":"bf412ea7-e9d5-498d-9890-4915a14f13f9","resolution":{"observed_at":"2026-05-26T21:28:22.884716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02485","last_updated":"2024-07-02T17:59:17Z","snapshot_observed_at":"2026-08-02T23:06:48.620448Z","submitted_at":"2024-07-02T17:59:17Z","title":"RankRAG: Unifying Context Ranking with Retrieval-Augmented Generation in LLMs","version":1},"cited_work":{"arxiv_id":"2407.02485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.02485","snapshot_observed_at":"2026-07-02T22:27:25.337234Z","title":"RankRAG: Unifying context ranking with retrieval-augmented generation in LLMs","venue":null,"work_id":"799746f1-22c1-47b4-b912-8651f2095e41","year":2024},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2407.02485","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:738d151d7ccfb4130e299caa332790cb87551148a1347d74358bd6599c2bab68","observation_id":"7fd9338a-9da1-4db5-8038-b4699f576411","resolution":{"observed_at":"2026-05-11T21:51:33.676238Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-02T10:04:41.853199Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":2,"metadata_mismatch":10,"parse_uncertain":0,"unresolved":2,"verified_exact":9,"verified_fuzzy":10},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 1 inbound Pith citation observation for arXiv:2604.24334."}