{"as_of":"2026-08-10T23:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d629e1398401f9b3d1a31b452212fbaa5cda4d4c3405c6ad9c83cad2edbcde35","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:46:48.069465Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T20:06:09.180245Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T12:46:14.734852Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17670","snapshot_observed_at":"2026-08-04T20:06:09.180245Z","title":"Towards Gen- eral Continuous Memory for Vision-Language Models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-08T13:29:23.405653Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.180245Z"},"links":{"cited_paper":"/paper/2505.17670","citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:09f10f94fd6b7ce1dbe74e7739f4daafece6dd5e3d75051bb37d5de58287c538","observation_id":"d2222c44-7745-4fec-99f5-5a4fc3d02b47","resolution":{"observed_at":"2026-08-04T20:06:09.180245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17670","snapshot_observed_at":"2026-08-03T06:04:53.456406Z","title":"Towards general continuous memory for vision-language models.arXiv preprint arXiv:2505.17670, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.00471","last_updated":"2026-06-05T06:11:46Z","snapshot_observed_at":"2026-08-10T16:49:13.302966Z","submitted_at":"2026-01-31T02:49:10Z","title":"Dual Latent Memory for Visual Multi-agent System","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T06:04:53.456406Z"},"links":{"cited_paper":"/paper/2505.17670","citing_paper":"/paper/2602.00471"},"observation_digest":"sha256:d2fbb2c5e72b9f3f6ccd76e464171f1aac9ad5dc9262983a442febfed67e1421","observation_id":"6642783a-77c2-42f9-a7e3-0c1bf2e562c8","resolution":{"observed_at":"2026-08-03T06:04:53.456406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17670","snapshot_observed_at":"2026-07-13T14:03:01.974171Z","title":"Towards general continuous memory for vision-language models.CoRR, abs/2505.17670, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.02029","last_updated":"2026-06-05T06:21:20Z","snapshot_observed_at":"2026-07-30T23:04:23.206455Z","submitted_at":"2026-04-02T13:36:37Z","title":"The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook","version":2},"reference_index":243,"source":"pdf_text","source_observed_at":"2026-07-13T14:03:01.974171Z"},"links":{"cited_paper":"/paper/2505.17670","citing_paper":"/paper/2604.02029"},"observation_digest":"sha256:a82b014cebc5df76115ff5f2ecde85eedc9834ea3c08367260994b8389ba992e","observation_id":"7657eba7-d3e1-4569-ae44-7480842fb4a5","resolution":{"observed_at":"2026-07-13T14:03:01.974171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2505.17670","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17670","snapshot_observed_at":"2026-07-09T12:46:14.734852Z","title":"Towards General Continuous Memory for Vision-Language Models","venue":"cs.LG","work_id":"42082462-faa6-4023-b79e-21293202ab24","year":2025},"citing_paper":{"arxiv_id":"2606.13680","last_updated":"2026-06-11T17:59:52Z","snapshot_observed_at":"2026-07-06T23:52:23.981568Z","submitted_at":"2026-06-11T17:59:52Z","title":"Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-27T06:30:55.592334Z"},"links":{"cited_paper":"/paper/2505.17670","citing_paper":"/paper/2606.13680"},"observation_digest":"sha256:5c09f6ef013d05940c14aaac4dcf81d27e4d499a1c2b3adab67960d1b1e8a9c1","observation_id":"ef4b830d-e506-4531-8d95-c8ed1bab1ac1","resolution":{"observed_at":"2026-07-03T15:28:33.935057Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2505.17670","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17670","snapshot_observed_at":"2026-07-09T12:46:14.734852Z","title":"Towards General Continuous Memory for Vision-Language Models","venue":"cs.LG","work_id":"42082462-faa6-4023-b79e-21293202ab24","year":2025},"citing_paper":{"arxiv_id":"2607.00159","last_updated":"2026-06-30T20:35:30Z","snapshot_observed_at":"2026-07-07T00:05:49.557137Z","submitted_at":"2026-06-30T20:35:30Z","title":"Identifying and Resolving Pitfalls of Knowledge-Based VQA Benchmarks: Auditing, Repairing, and Augmenting","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-02T19:13:44.015782Z"},"links":{"cited_paper":"/paper/2505.17670","citing_paper":"/paper/2607.00159"},"observation_digest":"sha256:503d719eacea20ceb33b71b1c3517739727eca79fa12f56248dc2c25ca8face2","observation_id":"8ea63aaf-ab62-4406-ae02-ad1908a9dbfc","resolution":{"observed_at":"2026-07-02T19:17:17.729849Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2505.17670","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17670","snapshot_observed_at":"2026-07-09T12:46:14.734852Z","title":"Towards General Continuous Memory for Vision-Language Models","venue":"cs.LG","work_id":"42082462-faa6-4023-b79e-21293202ab24","year":2025},"citing_paper":{"arxiv_id":"2607.07383","last_updated":"2026-07-08T13:15:39Z","snapshot_observed_at":"2026-07-11T23:20:03.206863Z","submitted_at":"2026-07-08T13:15:39Z","title":"MMAgent-R$^2$: Learning to Rerank and Reject for Agentic mRAG","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-09T12:37:07.906342Z"},"links":{"cited_paper":"/paper/2505.17670","citing_paper":"/paper/2607.07383"},"observation_digest":"sha256:32cf8d9739c2c7f70908faeeb81ecac9158de8327844a289044a307f125e564c","observation_id":"641cd9fc-40c1-475b-b9c1-50db348e4452","resolution":{"observed_at":"2026-07-09T12:46:14.736176Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17670","snapshot_observed_at":"2026-08-02T10:20:56.296609Z","title":"arXiv preprint arXiv:2505.17670 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22643","last_updated":"2026-06-24T02:40:49Z","snapshot_observed_at":"2026-08-08T03:20:50.943223Z","submitted_at":"2026-06-24T02:40:49Z","title":"Reason Before You Retrieve: Agentic Planning for Multi-modal RAG","version":1},"reference_index":162,"source":"arxiv_source","source_observed_at":"2026-08-02T10:20:56.296609Z"},"links":{"cited_paper":"/paper/2505.17670","citing_paper":"/paper/2607.22643"},"observation_digest":"sha256:461eaad12e1ab2883fe95e534ea6eae6fc0b22541a8a19fe5e1c2d27825cf5b1","observation_id":"8fa89f1a-d668-4203-9b84-dd6f543a8df5","resolution":{"observed_at":"2026-08-02T10:20:56.296609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.17670/citation-record","integrity":"/paper/2505.17670/integrity","json":"/paper/2505.17670/citation-record.json","paper":"/paper/2505.17670"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:41.872722Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901, 2020","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:41.872722Z"},"links":{"citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:6365d9a3ee64d1422cd1a5a2c9b6d2cbd3253dbac383bbe7ea9e99126bbeeead","observation_id":"b3ca604c-c72c-4282-8495-ee246efcc922","resolution":{"observed_at":"2026-08-07T14:46:41.872722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T14:46:41.988564Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:41.988564Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:df358fe70c6594766f6a812c9d1f6e6da2a05f3076b1bfbb16a4df4a32064fc7","observation_id":"278f4724-6492-4490-b066-f9d925d37e1b","resolution":{"observed_at":"2026-08-07T14:46:41.988564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.07051","last_updated":"2024-07-17T22:01:29Z","snapshot_observed_at":"2026-07-06T13:31:28.340143Z","submitted_at":"2022-07-14T16:51:09Z","title":"Language models show human-like content effects on reasoning tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.07051","snapshot_observed_at":"2026-08-07T14:46:42.111101Z","title":"Language models show human-like content effects on reasoning tasks.arXiv preprint arXiv:2207.07051, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:42.111101Z"},"links":{"cited_paper":"/paper/2207.07051","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:097d4a8b40ef8002c6c957c57ade66ba886c92365e0e513b47f7ab42e45515d3","observation_id":"c7dab02d-da0b-4b10-b0cc-2a045714eae9","resolution":{"observed_at":"2026-08-07T14:46:42.111101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00157","last_updated":"2024-09-16T19:20:59Z","snapshot_observed_at":"2026-08-10T10:27:46.046930Z","submitted_at":"2024-01-31T20:26:32Z","title":"Large Language Models for Mathematical Reasoning: Progresses and Challenges","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00157","snapshot_observed_at":"2026-08-07T14:46:42.184846Z","title":"Large language models for mathematical reasoning: Progresses and challenges.arXiv preprint arXiv:2402.00157, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:42.184846Z"},"links":{"cited_paper":"/paper/2402.00157","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:461683730c9bfb6ae6ec7676a673a8f552b5e8be5f2b9b6e3406dd3d152e8182","observation_id":"e9182548-547a-48f2-9993-f7c7ca9a5b69","resolution":{"observed_at":"2026-08-07T14:46:42.184846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:42.337052Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:42.337052Z"},"links":{"citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:7d35fde074cb4c85cfc8af0dd5d059da57f6fe913724454e79f7be2ad44dc0c0","observation_id":"6c45a2d7-0451-47f5-9157-735f62d6c4ca","resolution":{"observed_at":"2026-08-07T14:46:42.337052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00515","last_updated":"2024-11-10T22:02:27Z","snapshot_observed_at":"2026-07-29T20:40:25.374189Z","submitted_at":"2024-06-01T17:48:15Z","title":"A Survey on Large Language Models for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00515","snapshot_observed_at":"2026-08-07T14:46:42.431189Z","title":"A survey on large language models for code generation.arXiv preprint arXiv:2406.00515, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:42.431189Z"},"links":{"cited_paper":"/paper/2406.00515","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:7d5c743a16eb552ee81bd5d5e29df49b79cd1fcab5b5a6dec667553ba8d42562","observation_id":"76db0541-0b53-45f3-b104-aa73d6a6cdeb","resolution":{"observed_at":"2026-08-07T14:46:42.431189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11501","last_updated":"2025-05-29T09:18:35Z","snapshot_observed_at":"2026-08-10T17:11:29.807499Z","submitted_at":"2025-02-17T07:05:36Z","title":"Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11501","snapshot_observed_at":"2026-08-07T14:46:42.517303Z","title":"Token pruning in multimodal large language models: Are we solving the right problem?arXiv preprint arXiv:2502.11501, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:42.517303Z"},"links":{"cited_paper":"/paper/2502.11501","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:edc463bf36677491e6f05ffeecebed24ab82fc466d63aa0d71a4eef46531a8c6","observation_id":"19e41b4e-40f0-450f-bcd8-869d35eab58b","resolution":{"observed_at":"2026-08-07T14:46:42.517303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:52.043168Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks","venue":null,"work_id":"73dac2b4-f270-4159-bae1-4cedb6e7f990","year":2020},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:42.593852Z"},"links":{"citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:99e7e348cec961d348fc33d393020c08c4a6d4bebfd779e4dfe8bcd01fc80737","observation_id":"f9360e58-4bc3-4631-9051-5391a6c118bc","resolution":{"observed_at":"2026-08-07T14:46:52.115639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07174","last_updated":"2023-06-12T15:13:39Z","snapshot_observed_at":"2026-07-06T15:41:35.923624Z","submitted_at":"2023-06-12T15:13:39Z","title":"Augmenting Language Models with Long-Term Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07174","snapshot_observed_at":"2026-08-07T14:46:42.716548Z","title":"Augmenting language models with long-term memory.arXiv preprint arXiv:2306.07174, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:42.716548Z"},"links":{"cited_paper":"/paper/2306.07174","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:1426f32aa1da39de4f905a8d129eef36a8d048406f97d57d75060b9931d9ef89","observation_id":"a68b3edb-9eba-4b8d-ae60-3c7f152e9ada","resolution":{"observed_at":"2026-08-07T14:46:42.716548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:51.882347Z","title":"Realm: Retrieval-augmented language model pre-training","venue":null,"work_id":"75bab839-ac34-48a3-b54d-8046d191868d","year":2020},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:42.790901Z"},"links":{"citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:110eccdf13fd0da695882f150b3fa2368762370343a1071d3c14c9ee1a34e486","observation_id":"578c124b-2444-4e26-9170-fd8bad3a10bd","resolution":{"observed_at":"2026-08-07T14:46:51.943219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T14:46:42.912983Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:42.912983Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:c7a3484fa22ca00dca8622c031a25c06362f85ea050d06551482cc413534b385","observation_id":"dc929dfb-907b-4d47-b768-f72481c90c48","resolution":{"observed_at":"2026-08-07T14:46:42.912983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10594","last_updated":"2025-03-02T01:19:51Z","snapshot_observed_at":"2026-08-10T05:52:50.722724Z","submitted_at":"2024-10-14T15:04:18Z","title":"VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10594","snapshot_observed_at":"2026-08-07T14:46:42.990513Z","title":"Visrag: Vision-based retrieval-augmented generation on multi-modality documents.arXiv preprint arXiv:2410.10594, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:42.990513Z"},"links":{"cited_paper":"/paper/2410.10594","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:75ef276a4228a93ebdecdb4ada96f7d4c9d7a54caaee66dfa1f6924823691906","observation_id":"a1bfa9a7-30c5-4c65-87c5-1b36405c4fb8","resolution":{"observed_at":"2026-08-07T14:46:42.990513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:43.067006Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:43.067006Z"},"links":{"citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:41d037d37b90cd888abd8784433f08c4716e2d542a877b8a1ca659a54e7ba379","observation_id":"fe30ac93-9f60-40c0-869a-46dda89423ae","resolution":{"observed_at":"2026-08-07T14:46:43.067006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-07T14:46:43.129145Z","title":"Sparsevlm: Visual token sparsification for efficient vision-language model inference.arXiv preprint arXiv:2410.04417, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:43.129145Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:b88b7dd5138789233915de26efb8a2b395027309ffa778f14d310838002c1403","observation_id":"52cb878f-a48f-48f0-a17a-ff3fde0353f9","resolution":{"observed_at":"2026-08-07T14:46:43.129145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:51.650443Z","title":"A mathematical framework for transformer circuits.Transformer Circuits Thread, 2021.https://transformer-circuits.pub/2021/framework/index.html","venue":null,"work_id":"35689fb3-721d-43b7-a2e0-107b9739d79a","year":2021},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:43.199452Z"},"links":{"citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:1dfa066bee200518aceb9c8e465fa5e8cd7fdf9a6b7583fe1f570891313c7c49","observation_id":"ce541d28-98a3-46e5-9886-83af0d845f2f","resolution":{"observed_at":"2026-08-07T14:46:51.738013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-07T14:46:43.352571Z","title":"In-context learning and induction heads.arXiv preprint arXiv:2209.11895, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:43.352571Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:d0bf5aa34d6120be7445c9336767b2d3c60f46afdcd6eb6209c745dd8503b819","observation_id":"a3810cb5-551b-4efc-90e1-76fbca416c3e","resolution":{"observed_at":"2026-08-07T14:46:43.352571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-07T06:05:27.895209Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-08-07T14:46:43.470015Z","title":"Training large language models to reason in a continuous latent space.arXiv preprint arXiv:2412.06769, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:43.470015Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:3d10ca28227368f47e6142e67b0014a7d3c867cfaa4f6768383aeabbedb9aadf","observation_id":"c1fad45e-028b-4846-a9f7-d268c0862a81","resolution":{"observed_at":"2026-08-07T14:46:43.470015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14795","last_updated":"2022-03-15T22:37:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-30T17:53:34Z","title":"Perceiver IO: A General Architecture for Structured Inputs & Outputs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14795","snapshot_observed_at":"2026-08-07T14:46:43.619890Z","title":"Botvinick, Andrew Zisserman, Oriol Vinyals, and João Carreira","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:43.619890Z"},"links":{"cited_paper":"/paper/2107.14795","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:384858b76928cce4d944397b8da20802c87b582ea59e3ab7784b14ada9530d3f","observation_id":"5f70f8f0-2107-458d-9953-dc94385df636","resolution":{"observed_at":"2026-08-07T14:46:43.619890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:51.455465Z","title":"Kanwal, Tegan Maharaj, Asja Fischer, Aaron Courville, Yoshua Bengio, and Simon Lacoste-Julien","venue":null,"work_id":"99b497ce-e67c-47a7-a019-72fe36405ff3","year":2017},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:43.739351Z"},"links":{"citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:dcb4cce04dd8c839a38dd9cae12d3e4ca6edb62dce27f03b45a63507b5c0a301","observation_id":"41e3e058-dcf4-4e39-a23a-39d94734ca0d","resolution":{"observed_at":"2026-08-07T14:46:51.527275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:51.248499Z","title":"The trade-offs of domain adaptation for neural language models","venue":null,"work_id":"5f80036b-1bbc-40d6-90b2-37e354564c96","year":2022},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:43.816405Z"},"links":{"citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:7b44bdb77b6e64ee7a49d7b1633f52e1e45f752d8df295df47f1f4ca8ca41648","observation_id":"ade8e379-f223-4f6c-8e2d-a94d7ea002a7","resolution":{"observed_at":"2026-08-07T14:46:51.349093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-07T14:46:43.886123Z","title":"Attention is all you need.arXiv preprint arXiv:1706.03762, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:43.886123Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:2d8c86e70449b5fb15865bde06521c307856698451eff8efee39b7a9f3e94ced","observation_id":"55695af3-c974-40c8-8108-c350d956c877","resolution":{"observed_at":"2026-08-07T14:46:43.886123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04341","last_updated":"2019-06-11T01:31:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-06-11T01:31:41Z","title":"What Does BERT Look At? An Analysis of BERT's Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.04341","snapshot_observed_at":"2026-08-07T14:46:43.963486Z","title":null,"venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:43.963486Z"},"links":{"cited_paper":"/paper/1906.04341","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:a321e51891e59ec436dc2016e28589765ee037bfe578516e22e0f150c39ab299","observation_id":"962c04ef-2a93-492b-8a05-7393312cf113","resolution":{"observed_at":"2026-08-07T14:46:43.963486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T14:46:44.075042Z","title":"Lora: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:44.075042Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:86d3ec31adecc3a260b3608279ce6efeba59113ed0661716908457a6331600bc","observation_id":"37383aeb-aba5-439d-a240-f36929e4a534","resolution":{"observed_at":"2026-08-07T14:46:44.075042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-07T14:46:44.189348Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models.arXiv preprint arXiv:2301.12597, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:44.189348Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:ea43915665417a349650b034139e4319993290445da8a98ea6477da284b50457","observation_id":"1b26f56e-ef01-4ef6-afc2-d7fe685e034b","resolution":{"observed_at":"2026-08-07T14:46:44.189348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12735","last_updated":"2024-12-02T02:34:47Z","snapshot_observed_at":"2026-08-05T16:52:46.144105Z","submitted_at":"2024-07-17T16:55:42Z","title":"EchoSight: Advancing Visual-Language Models with Wiki Knowledge","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12735","snapshot_observed_at":"2026-08-07T14:46:44.260422Z","title":"Echosight: Advancing visual-language models with wiki knowledge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:44.260422Z"},"links":{"cited_paper":"/paper/2407.12735","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:251190a0cd632a4847d4ab775900e71e863b676710e31f62ebd4e9912fd14d8e","observation_id":"8efb0f53-c2e0-43c8-9e89-beba86e99e88","resolution":{"observed_at":"2026-08-07T14:46:44.260422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16863","last_updated":"2025-04-02T06:19:46Z","snapshot_observed_at":"2026-07-06T19:56:52.724589Z","submitted_at":"2024-11-25T19:01:03Z","title":"Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16863","snapshot_observed_at":"2026-08-07T14:46:44.356720Z","title":"Augmenting multimodal llms with self-reflective tokens for knowledge-based visual question answering.arXiv preprint arXiv:2411.16863, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:44.356720Z"},"links":{"cited_paper":"/paper/2411.16863","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:9c1da26b9b1e939d8c8e1746d44a019fa9dfe2112689f6a12554c18261166467","observation_id":"8109059b-35dd-4671-8911-22da5803b3ed","resolution":{"observed_at":"2026-08-07T14:46:44.356720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08876","last_updated":"2024-10-14T20:31:13Z","snapshot_observed_at":"2026-08-04T21:17:26.164677Z","submitted_at":"2024-10-11T14:51:00Z","title":"RoRA-VLM: Robust Retrieval-Augmented Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08876","snapshot_observed_at":"2026-08-07T14:46:44.456987Z","title":"RORA-VLM: Robust retrieval augmentation for vision language models.arXiv preprint arXiv:2410.08876, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:44.456987Z"},"links":{"cited_paper":"/paper/2410.08876","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:846770eabeb2de4a8ea6076ab0ec09a363fd01bdcfb8c53dcd46129101740c14","observation_id":"f41da4d5-2059-4b1f-bb89-b810023dae84","resolution":{"observed_at":"2026-08-07T14:46:44.456987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13792","last_updated":"2024-12-09T06:07:03Z","snapshot_observed_at":"2026-08-03T20:12:47.789392Z","submitted_at":"2024-05-22T16:15:17Z","title":"xRAG: Extreme Context Compression for Retrieval-augmented Generation with One Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13792","snapshot_observed_at":"2026-08-07T14:46:44.553768Z","title":"xrag: Extreme context compression for retrieval-augmented generation with one token.arXiv preprint arXiv:2405.13792, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:44.553768Z"},"links":{"cited_paper":"/paper/2405.13792","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:7dbde29be13aff5c740b85ed689391a946953608f0912e5ae541fa6dfd628078","observation_id":"ed55e627-01c3-4b98-bb44-a9d824170bfd","resolution":{"observed_at":"2026-08-07T14:46:44.553768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10337","last_updated":"2025-03-13T13:15:28Z","snapshot_observed_at":"2026-08-07T17:07:11.092751Z","submitted_at":"2025-03-13T13:15:28Z","title":"KV-Distill: Nearly Lossless Learnable Context Compression for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10337","snapshot_observed_at":"2026-08-07T14:46:44.661849Z","title":"Kv-distill: Nearly lossless learnable context compression for llms.ArXiv, abs/2503.10337, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:44.661849Z"},"links":{"cited_paper":"/paper/2503.10337","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:86615db66fa6b3964a6ba4a412916babe6f972da43d43a71e2154bbd787f74b3","observation_id":"b46d3d36-0c01-4465-ad51-30287da5651b","resolution":{"observed_at":"2026-08-07T14:46:44.661849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-07-06T18:32:44.452493Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-07T14:46:44.748456Z","title":"V oco-llama: Towards vision compression with large language models.arXiv preprint arXiv:2406.12275, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:44.748456Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:4dd1f9f53837442ba3082b2848c44d12aeb342cf548182d23e7834d62d54a06f","observation_id":"03a1e32b-abe3-466e-a411-0abe0a4039db","resolution":{"observed_at":"2026-08-07T14:46:44.748456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05726","last_updated":"2024-04-24T15:38:48Z","snapshot_observed_at":"2026-08-09T23:36:22.208556Z","submitted_at":"2024-04-08T17:59:24Z","title":"MA-LMM: Memory-Augmented Large Multimodal Model for Long-Term Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05726","snapshot_observed_at":"2026-08-07T14:46:44.831913Z","title":"MA-LMM: Memory-augmented large multimodal model for long-term video understanding.arXiv preprint arXiv:2404.05726, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:44.831913Z"},"links":{"cited_paper":"/paper/2404.05726","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:a696ba91090eb99bd0613fc6cb6a9c43d24fea252866f5140bbdd67552a41a9c","observation_id":"9eb46eb0-8e47-4268-81dc-38ff53e2fe95","resolution":{"observed_at":"2026-08-07T14:46:44.831913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00592","last_updated":"2025-05-30T14:40:56Z","snapshot_observed_at":"2026-08-10T17:44:50.847798Z","submitted_at":"2025-02-01T23:13:10Z","title":"M+: Extending MemoryLLM with Scalable Long-Term Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00592","snapshot_observed_at":"2026-08-07T14:46:44.941755Z","title":"M+: Extending memoryllm with scalable long-term memory.arXiv preprint arXiv:2502.00592, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:44.941755Z"},"links":{"cited_paper":"/paper/2502.00592","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:a84846fef790392e052456ec8d2bd8f2a5390ba4f9c9bb0f6c11c43cc2bf0097","observation_id":"ceb034a8-c31f-4dc9-a8c5-183750514798","resolution":{"observed_at":"2026-08-07T14:46:44.941755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08560","last_updated":"2024-02-12T18:59:46Z","snapshot_observed_at":"2026-08-09T03:13:16.831626Z","submitted_at":"2023-10-12T17:51:32Z","title":"MemGPT: Towards LLMs as Operating Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08560","snapshot_observed_at":"2026-08-07T14:46:45.067719Z","title":"Memgpt: Towards llms as operating systems.arXiv preprint arXiv:2310.08560, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:45.067719Z"},"links":{"cited_paper":"/paper/2310.08560","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:33dcd670e25936fefa1f861be16e7019609abf7038e6cd8582bc06274512dc1e","observation_id":"cd50865a-ef74-4eca-b4bb-25b067d1503b","resolution":{"observed_at":"2026-08-07T14:46:45.067719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-10T06:24:49.807173Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-08-07T14:46:45.236100Z","title":"Can pre-trained vision and language models answer visual information-seeking questions?arXiv preprint arXiv:2302.11713, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:45.236100Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:7cf6df23a31df3fa496faaa9dcfecc5465f6da5fe7abf4243d567eff48a31ed3","observation_id":"16a8baad-8059-40d3-af0d-6ecc6d78427f","resolution":{"observed_at":"2026-08-07T14:46:45.236100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:45.381572Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:45.381572Z"},"links":{"citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:daa4b5d98e4f65f4d4bf2fb70291df34da29bb992503fba6852df21c693df519","observation_id":"c86d863a-91bf-48be-aebf-2140ac37ae56","resolution":{"observed_at":"2026-08-07T14:46:45.381572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:51.029020Z","title":"A-okvqa: A benchmark for visual question answering using world knowledge","venue":null,"work_id":"df1728c3-fde0-4157-bf26-a713c7fbc8a1","year":2022},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:45.520086Z"},"links":{"citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:3c6a783c8c6dd59c266485cd0c5af78b937d57915a12053ac7962f9247521c2e","observation_id":"c5013a54-ceaf-4073-bf67-3fb52dcb7ccc","resolution":{"observed_at":"2026-08-07T14:46:51.094243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15406","last_updated":"2024-05-22T07:15:18Z","snapshot_observed_at":"2026-07-06T18:04:37.961164Z","submitted_at":"2024-04-23T18:00:09Z","title":"Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2404.15406","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.15406","snapshot_observed_at":"2026-08-07T14:46:48.552095Z","title":"Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs","venue":"cs.CV","work_id":"f74128a4-3c72-4446-a674-18bfab556d33","year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:45.642876Z"},"links":{"cited_paper":"/paper/2404.15406","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:59c551e60bfaa4b4151d230e6c8daa7022d2387f2f1817a9eb64d1b657f3f2b0","observation_id":"3bae3da7-054f-4a19-89dc-c3541920b6fd","resolution":{"observed_at":"2026-08-07T14:46:48.624520Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:45.818280Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:45.818280Z"},"links":{"citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:33993adc6ab86917ea0c0271160fd1fabf67d345a9d9bd4b8d27370cf3125348","observation_id":"84408c59-a160-45c6-b174-057ff4613ccb","resolution":{"observed_at":"2026-08-07T14:46:45.818280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:50.834499Z","title":"Wit: Wikipedia-based image text dataset for multimodal multilingual machine learning","venue":null,"work_id":"45a68461-323c-4d48-928a-f972002b2300","year":2021},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:45.983414Z"},"links":{"citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:4d26fa9cf55c8128773586aa67d81252932fb082bd4bc3bb238152781d56558e","observation_id":"3a40a3f2-b76e-4de8-841e-312eea322af1","resolution":{"observed_at":"2026-08-07T14:46:50.906780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:50.700144Z","title":"Encyclopedic vqa: Visual questions about detailed properties of fine-grained categories","venue":null,"work_id":"d8c3dc37-588b-4346-9583-b4d4f67d4794","year":2023},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:46.175604Z"},"links":{"citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:35c2177482812d75e038321d9bef7a8f6e79de97f7f8ec50319eb6be80dcd985","observation_id":"5e49f585-c4bc-4e47-b17c-275a90d4551a","resolution":{"observed_at":"2026-08-07T14:46:50.748700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:46.320220Z","title":"Open-domain visual entity recognition: Towards recognizing millions of wikipedia entities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:46.320220Z"},"links":{"citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:684fae85c9c62927c1c0a430e5e8caf6e4143064a63864ff7f78f34504a91332","observation_id":"ea0a8ad6-fd27-4b25-a64c-1fe69f0e084d","resolution":{"observed_at":"2026-08-07T14:46:46.320220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08182","last_updated":"2025-03-19T20:58:37Z","snapshot_observed_at":"2026-08-10T07:06:12.794006Z","submitted_at":"2024-10-10T17:55:02Z","title":"MRAG-Bench: Vision-Centric Evaluation for Retrieval-Augmented Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08182","snapshot_observed_at":"2026-08-07T14:46:46.436410Z","title":"Mrag-bench: Vision-centric evaluation for retrieval-augmented multimodal models.arXiv preprint arXiv:2410.08182, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:46.436410Z"},"links":{"cited_paper":"/paper/2410.08182","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:515121745e0a9d5f874abd2083c41cc6fb194d93d38f12f5241d9113c15f5e08","observation_id":"53986ec4-e589-4e80-a516-5f5bbe5bfa7a","resolution":{"observed_at":"2026-08-07T14:46:46.436410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:50.509176Z","title":"Viquae, a dataset for knowledge-based visual question answering about named entities","venue":null,"work_id":"493fc91c-72ea-4102-bc1c-729220ca3816","year":2022},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:46.556914Z"},"links":{"citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:d665dae6d1bd84ef1e429728cbdbfcfcee159f797142af4312bb966b24944dbf","observation_id":"45e49340-0ac3-4d5c-b74a-89d0f684452c","resolution":{"observed_at":"2026-08-07T14:46:50.599296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-07-06T18:27:54.379381Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-08-07T14:46:46.670649Z","title":"CVQA: Culturally-diverse multilingual visual question answering benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:46.670649Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:cca2d5569bcf6c6ab76ddc85c00dc7486ca7c09cfe22db4cb7c9a6dbdf20f344","observation_id":"9da75c24-78c1-4c9f-a009-e9e5cef09de6","resolution":{"observed_at":"2026-08-07T14:46:46.670649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:50.287049Z","title":"Gpt-4o technical report, 2024","venue":null,"work_id":"a5e12bf6-29d8-47b8-9bfd-b9a7d2b6df5f","year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:46.762361Z"},"links":{"citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:8e2d06b4cdf45791ab3f96422191b9c0180cef06efeb9f9a2bb844eca700670c","observation_id":"8e1c4b10-3cb9-435e-a872-12f2ddef8860","resolution":{"observed_at":"2026-08-07T14:46:50.397738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-07T14:46:46.835689Z","title":"Visual instruction tuning.arXiv preprint arXiv:2304.08485, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:46.835689Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:172a7bd35295abdb2c72db141aef37ad1bb305f575bae4e395425a769c9a9974","observation_id":"0c0b63b3-180b-4a61-a0f8-e443ebfa1fd4","resolution":{"observed_at":"2026-08-07T14:46:46.835689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:50.097847Z","title":"Llava-next: Open large multimodal models","venue":null,"work_id":"bbc4b64b-d989-43fb-b9d5-72975d64f0ff","year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:46.953015Z"},"links":{"citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:6facdfdba46fb82ee59c44ae675f90a8b97e2257f3a0fb3074888834b0402059","observation_id":"c17250c3-a35b-4426-8a90-8dfa58cf63ff","resolution":{"observed_at":"2026-08-07T14:46:50.187196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-07T14:46:47.018889Z","title":"Internlm- xcomposer-2.5: A versatile large vision language model supporting long-contextual input and output.arXiv preprint arXiv:2407.03320, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:47.018889Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:6174cbc44e85ec1bc993a227d3dc75d2d6d80f0c23d4c38b24dd157c17a95577","observation_id":"6688bed2-a55f-492c-af4f-e69bfeb2c54f","resolution":{"observed_at":"2026-08-07T14:46:47.018889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-07T14:46:47.087644Z","title":"mplug-owl3: Towards long image-sequence understanding in multi-modal large language models.arXiv preprint arXiv:2408.04840, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:47.087644Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:58d0b3b07e9ec791e7e5c6c8f3635d81cc19355745c4de4b827b1bbde1911a67","observation_id":"0cc38497-8a40-401c-ad73-95df2674128c","resolution":{"observed_at":"2026-08-07T14:46:47.087644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T14:46:47.157556Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:47.157556Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:697fa56b35a72bbd3e7cb5c91c1f0a465bef092b06a67279dd738a03a97333cf","observation_id":"6adb41ec-9728-4a2b-ba4a-65269eeac399","resolution":{"observed_at":"2026-08-07T14:46:47.157556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:46:47.255694Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:47.255694Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:94420995623bced5f13a5105ffbb7e15534c22da472e23e6b4926a15c41a791d","observation_id":"71eb6c5c-9535-4755-8397-d6678dd7535c","resolution":{"observed_at":"2026-08-07T14:46:47.255694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:47.396550Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:47.396550Z"},"links":{"citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:d8d20a6373e8991327469e79f721ac595eb872e0fb5753c07972551a29c74f8f","observation_id":"51587dfb-240b-437c-a0b9-2ad31a711c0f","resolution":{"observed_at":"2026-08-07T14:46:47.396550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:47.494110Z","title":"Mm1: methods, analysis and insights from multimodal llm pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:47.494110Z"},"links":{"citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:df3bbc0f6fd2606a87e7fed666976ab37b1e23a5aaffe19c63b35dea67cdad00","observation_id":"076259f0-863f-4afb-b3b4-2af3a8426ac0","resolution":{"observed_at":"2026-08-07T14:46:47.494110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:49.817384Z","title":"Ulip-2: Towards scalable multimodal pre-training for 3d understanding","venue":null,"work_id":"27c2f0e2-bf14-4d40-862e-b9a9d02b6fbc","year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:47.577690Z"},"links":{"citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:7cdccfbf8da8933093bc49f38a10d052984c359f9e92613a9798ca7c6b9e6af6","observation_id":"d3b92a26-f366-4a72-b07e-6a44d775a3ef","resolution":{"observed_at":"2026-08-07T14:46:49.929357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:47.682456Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:47.682456Z"},"links":{"citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:013e8d792bced0b18f3ae945ccb69f6e31e82456c72889b0bd8777357c537ef6","observation_id":"f310d7f9-4473-4ad9-a8d6-dedaed9b76d3","resolution":{"observed_at":"2026-08-07T14:46:47.682456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:47.790233Z","title":"Learning to compress prompts with gist tokens","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:47.790233Z"},"links":{"citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:65f2fb1c756730c1d4d1cf714c7acc83a643a9e4170b6c8ecfbfdabc26bfa5c8","observation_id":"dc6558bf-75bb-4a7a-86d8-ed1b32ac341d","resolution":{"observed_at":"2026-08-07T14:46:47.790233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13618","last_updated":"2024-11-05T13:17:56Z","snapshot_observed_at":"2026-07-06T18:33:45.816337Z","submitted_at":"2024-06-19T15:14:55Z","title":"In-Context Former: Lightning-fast Compressing Context for Large Language Model","version":2},"cited_work":{"arxiv_id":"2406.13618","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.13618","snapshot_observed_at":"2026-08-07T14:46:48.189693Z","title":"In-Context Former: Lightning-fast Compressing Context for Large Language Model","venue":"cs.CL","work_id":"37b923bb-a060-4f4a-93e8-82ce744d88e9","year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:47.871762Z"},"links":{"cited_paper":"/paper/2406.13618","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:64e91ccb12351848b789bb9513b1a010eb5b4145ba96ab671e0e81fe1b5f632d","observation_id":"458aabc8-aea5-4415-a175-1c59dd54f241","resolution":{"observed_at":"2026-08-07T14:46:48.281292Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:49.517470Z","title":"Adapting llms for efficient context processing through soft prompt compression","venue":null,"work_id":"12e57cc7-d846-41a9-af0f-17afb237ea53","year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:47.968827Z"},"links":{"citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:5edf1480bb5784ecfbf53b7c0531a012485fb099b53325a31654815c3c20cf46","observation_id":"2d1aa9f7-4054-450e-83c6-9d10d4a87332","resolution":{"observed_at":"2026-08-07T14:46:49.643233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:49.376636Z","title":"The probabilistic relevance framework: Bm25 and beyond.F oundations and Trends in Information Retrieval, 3(4):333–389, 2009","venue":null,"work_id":"a4da361d-7d5e-440f-82a7-9bf117a763c6","year":2009},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:48.069465Z"},"links":{"citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:c5972269dd1039d5927adb23df11f2dd703d7760d7732959906ffdb2337061d4","observation_id":"af99f633-c4e5-4982-91d7-ec761ca23a6e","resolution":{"observed_at":"2026-08-07T14:46:49.442737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":2,"verified_fuzzy":14},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 7 inbound Pith citation observations for arXiv:2505.17670."}