{"as_of":"2026-08-07T18:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:73cf3817512f2d5c34199da89f4940f28671c6203e8b52719e894fda35051e3e","coverage":[{"denominator":114,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T06:02:30.468386Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T01:49:15.136031Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T16:01:23.018232Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"cited_work":{"arxiv_id":"2506.06279","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06279","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"356ce2fd-c620-457c-b065-3dbf6be01722","year":2025},"citing_paper":{"arxiv_id":"2605.00814","last_updated":"2026-05-08T16:52:48Z","snapshot_observed_at":"2026-07-06T23:14:11.211164Z","submitted_at":"2026-05-01T17:54:37Z","title":"Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-09T18:53:06.494640Z"},"links":{"cited_paper":"/paper/2506.06279","citing_paper":"/paper/2605.00814"},"observation_digest":"sha256:0328592ada865cc70c0f690b08192d1f5bdb3b2eb706084cc3a88ba8527b8551","observation_id":"141c552d-38db-4546-9c1b-cf0bfe83f149","resolution":{"observed_at":"2026-05-11T16:01:23.021630Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"cited_work":{"arxiv_id":"2506.06279","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06279","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"356ce2fd-c620-457c-b065-3dbf6be01722","year":2025},"citing_paper":{"arxiv_id":"2605.00814","last_updated":"2026-05-08T16:52:48Z","snapshot_observed_at":"2026-07-06T23:14:11.211164Z","submitted_at":"2026-05-01T17:54:37Z","title":"Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-11T01:49:15.136031Z"},"links":{"cited_paper":"/paper/2506.06279","citing_paper":"/paper/2605.00814"},"observation_digest":"sha256:14b62f6dcd0e66555999ca271ca7f4901a66bbeb09739a25ef5cb849d9b27ab7","observation_id":"a6c78e64-9adc-4225-94c0-35ecef142c6c","resolution":{"observed_at":"2026-05-11T01:50:51.525657Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.06279/citation-record","integrity":"/paper/2506.06279/integrity","json":"/paper/2506.06279/citation-record.json","paper":"/paper/2506.06279"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.127567Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.127567Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:310a79523515c3bbec3547219334bb471086c15001400a9ef4b068ea596683ee","observation_id":"79d773ee-f286-40d3-bd8a-4f084176938d","resolution":{"observed_at":"2026-08-07T06:02:30.127567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.132542Z","title":"Nocaps: Novel object captioning at scale","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.132542Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:f7ebd2e82a0f02192328792c367e82991981c226c7281ad99e8240f75bb70e5b","observation_id":"1b37105c-5bfe-48d5-a435-308641a2b8b8","resolution":{"observed_at":"2026-08-07T06:02:30.132542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.136019Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.136019Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:82fb577a93e36de01751aea084f672c788d83fbef37151f8351c2cd8bd119b1e","observation_id":"7646e2aa-2a92-4878-a2de-6d3de73342b7","resolution":{"observed_at":"2026-08-07T06:02:30.136019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13319","last_updated":"2019-05-30T21:28:12Z","snapshot_observed_at":"2026-07-06T07:56:54.143277Z","submitted_at":"2019-05-30T21:28:12Z","title":"MathQA: Towards Interpretable Math Word Problem Solving with Operation-Based Formalisms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13319","snapshot_observed_at":"2026-08-07T06:02:30.139466Z","title":"Mathqa: Towards interpretable math word problem solving with operation-based formalisms","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.139466Z"},"links":{"cited_paper":"/paper/1905.13319","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:b8636b195c0d3d74f447f0e56e3527585ed78c4670e47505d2f44634df9fca34","observation_id":"f750bb2f-0dcb-4ec5-bf3c-732c7d48c15b","resolution":{"observed_at":"2026-08-07T06:02:30.139466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.143129Z","title":"A., Datla, V","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.143129Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:b3c44aff3ecd9bf1fa228a3dd8c2444681106fc0960343b1734154c50fa267af","observation_id":"def89704-aae5-45d8-a5ac-d1f50160c601","resolution":{"observed_at":"2026-08-07T06:02:30.143129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.146609Z","title":"F., Tito, R., Mafla, A., Gomez, L., Rusinol, M., Valveny, E., Jawahar, C., and Karatzas, D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.146609Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:4aee27e60127114db8246abd50b8f0cc7eea028a1cfb0a04a4c06488c50f649e","observation_id":"2e30b908-a5a0-41d9-9b70-8ab804a9e781","resolution":{"observed_at":"2026-08-07T06:02:30.146609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.150059Z","title":"Coyo-700m: Image-text pair dataset","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.150059Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:bb7783db348ec64d47d1c829db16291d6f0784dafb3bfa2d72a6a1a8f4224766","observation_id":"b8d49dac-16a7-4aa6-825c-c39d28fffe1e","resolution":{"observed_at":"2026-08-07T06:02:30.150059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.154200Z","title":"and Xiao, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.154200Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:097755429bc30ea7bdcc70c295cae040da4153773bf041ca128f5fc37b2b93fe","observation_id":"8a9ee46c-ef58-4c1f-ae7b-45ef3d6f2469","resolution":{"observed_at":"2026-08-07T06:02:30.154200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.157676Z","title":"Textocr-gpt4v","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.157676Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:962f8dce98936463e4d22df6461fe4aee73e16ac70e56f290ba92f1b7b36347c","observation_id":"05435e20-be77-4581-9970-3db59625d8a3","resolution":{"observed_at":"2026-08-07T06:02:30.157676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.08545","last_updated":"2022-11-15T22:31:38Z","snapshot_observed_at":"2026-07-06T14:18:49.988227Z","submitted_at":"2022-11-15T22:31:38Z","title":"MapQA: A Dataset for Question Answering on Choropleth Maps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.08545","snapshot_observed_at":"2026-08-07T06:02:30.160890Z","title":"Mapqa: A dataset for question answering on choropleth maps","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.160890Z"},"links":{"cited_paper":"/paper/2211.08545","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:7faff7f25bb4af58f1993de65b18a2733090b6a2141cbed2099e8c774ee0f3c3","observation_id":"ea0cc5cf-0707-45eb-84f8-9d044095792f","resolution":{"observed_at":"2026-08-07T06:02:30.160890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-07T06:02:30.164986Z","title":"H., Chen, S., Zhang, R., Chen, J., Wu, X., Zhang, Z., Chen, Z., Li, J., Wan, X., and Wang, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.164986Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:29a6e66d0590739dcf97231d4cfea538a9e6ab13ee408c991f0c37ec02d7f8b3","observation_id":"e07abd60-3b54-47fa-9573-77bf4aa61664","resolution":{"observed_at":"2026-08-07T06:02:30.164986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.02746","last_updated":"2022-12-06T04:37:51Z","snapshot_observed_at":"2026-08-06T05:59:54.593795Z","submitted_at":"2022-12-06T04:37:51Z","title":"UniGeo: Unifying Geometry Logical Reasoning via Reformulating Mathematical Expression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.02746","snapshot_observed_at":"2026-08-07T06:02:30.168722Z","title":"Unigeo: Unifying geometry logical reasoning via reformulating mathematical expression","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.168722Z"},"links":{"cited_paper":"/paper/2212.02746","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:c9fd9ccede504f8072ff6c820bee34c5e07279db2279c34403f59bd619a02b83","observation_id":"59f67add-d782-4305-b878-8925ec32c11e","resolution":{"observed_at":"2026-08-07T06:02:30.168722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-07T06:02:30.172306Z","title":"Shikra: Unleashing multimodal llm's referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.172306Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:0831774ba8f8a778f5ca409a59bff827460344172e6954699be0579595091818","observation_id":"ae2a3243-366e-4ca9-bc2f-638aae7bf3b1","resolution":{"observed_at":"2026-08-07T06:02:30.172306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14177","last_updated":"2024-07-19T10:09:51Z","snapshot_observed_at":"2026-07-06T18:48:58.038753Z","submitted_at":"2024-07-19T10:09:51Z","title":"EVLM: An Efficient Vision-Language Model for Visual Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14177","snapshot_observed_at":"2026-08-07T06:02:30.175851Z","title":"Evlm: An efficient vision-language model for visual understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.175851Z"},"links":{"cited_paper":"/paper/2407.14177","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:527fe1788ee4f58eee832ec8cd7d32fae96095aded747c03484752d475f02c96","observation_id":"aa14a1d1-29be-4aeb-89cf-76468b19416b","resolution":{"observed_at":"2026-08-07T06:02:30.175851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T06:02:30.179318Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.179318Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:fe7922d4f25c2064a343f69d308a8776bfe70d37a593cbba7ca7a41bc063692d","observation_id":"bbc65fc0-80bd-44e0-a9d6-e376db1066f4","resolution":{"observed_at":"2026-08-07T06:02:30.179318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.04729","last_updated":"2019-08-28T16:24:53Z","snapshot_observed_at":"2026-07-06T08:14:10.191646Z","submitted_at":"2019-08-13T16:47:08Z","title":"Complicated Table Structure Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.04729","snapshot_observed_at":"2026-08-07T06:02:30.182794Z","title":"Complicated table structure recognition","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.182794Z"},"links":{"cited_paper":"/paper/1908.04729","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:dd8595388c6f2cfcddabb8f73a37b0d34a70fd7662eac278f48080d3eb1e5e82","observation_id":"de2765e1-0281-4a57-8c39-37fe9e9ebe9e","resolution":{"observed_at":"2026-08-07T06:02:30.182794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.187512Z","title":"K., Liu, Y., Sun, Y., Ng, C","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.187512Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:4f1b7414c1cc714c97211985f41f1f71b80168d7c2a8401d81adbbebcb119d69","observation_id":"8b42769e-724d-4fc0-9d0c-1b09306a9c0f","resolution":{"observed_at":"2026-08-07T06:02:30.187512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.10723","last_updated":"2017-11-07T18:55:35Z","snapshot_observed_at":"2026-07-06T06:06:40.044133Z","submitted_at":"2017-10-29T23:47:49Z","title":"Simple and Effective Multi-Paragraph Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.10723","snapshot_observed_at":"2026-08-07T06:02:30.190767Z","title":"and Gardner, M","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.190767Z"},"links":{"cited_paper":"/paper/1710.10723","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:7086aade2552f3bc5ce189bbcee0d3b192708e8721cc06973b49818c1e373010","observation_id":"cd94c8a4-0aba-436e-a7a4-f13cea61dff6","resolution":{"observed_at":"2026-08-07T06:02:30.190767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-07-06T19:17:02.745056Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-08-07T06:02:30.194240Z","title":"Nvlm: Open frontier-class multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.194240Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:2fbc4698f903225006d7fdea0660ee59e036669ff60dbb89e57aac1bb5b682a1","observation_id":"33df9bd5-09bf-4ca6-8a80-9c1818466996","resolution":{"observed_at":"2026-08-07T06:02:30.194240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.197809Z","title":"Deep visual template-free form parsing","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.197809Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:c35471ed33be07ec4809b7405fd30515b408a88d71552cbe748a02c0705d30a7","observation_id":"ff4a96ac-f9d2-4b61-bde0-f07a2c0002e3","resolution":{"observed_at":"2026-08-07T06:02:30.197809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T06:02:30.201168Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.201168Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:17311d7945d754581cdd6c91db2a428599dd10995eb6bcff9045093d69d5f6de","observation_id":"1af4d204-7229-42ac-9f8c-b5f8dca7c0f4","resolution":{"observed_at":"2026-08-07T06:02:30.201168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T06:02:30.204597Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.204597Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:91d946b8486522ba3cd7849ea49fc68e8c227ef26b8ff268f8f7f523a6eb0c75","observation_id":"6ae6ab93-5751-4fb2-98a7-9ddc968e5796","resolution":{"observed_at":"2026-08-07T06:02:30.204597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.208209Z","title":"A., Ma, W.-C., and Krishna, R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.208209Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:14ca09b92fb8396d86dbf86fddb495ee064859e49067509f5e570c16c959344e","observation_id":"763727de-789a-4026-a5f0-6c930777ce2c","resolution":{"observed_at":"2026-08-07T06:02:30.208209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.211435Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.211435Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:c1334ef1d10c7ac5036b3ac895b9c537966102507583fec11375318958153c17","observation_id":"4544efaf-0813-4a67-9ba4-cbd5ad03d612","resolution":{"observed_at":"2026-08-07T06:02:30.211435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.214909Z","title":"Wukong: A 100 million large-scale chinese cross-modal pre-training benchmark","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.214909Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:6b51c1cfe7790f30611517e8f723360e41ae2be5d81a2eaa3ba0c66290652c86","observation_id":"12fc4599-f778-4b46-a339-87cc2d6b3369","resolution":{"observed_at":"2026-08-07T06:02:30.214909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.218140Z","title":"Eaten: Entity-aware attention for single shot visual text extraction","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.218140Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:7378fa57a6abac9704cdb1b77f541134b5eb7cb3153ba9b5c0b65bfb1e15aa82","observation_id":"52e019b4-ae1e-4d76-a27d-ed70e62f19f6","resolution":{"observed_at":"2026-08-07T06:02:30.218140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.221368Z","title":"Icpr2018 contest on robust reading for multi-type web images","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.221368Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:ce04bc7e450a695c48518f17d1cba78caa0a00a1858ace0f1a9a5195bf04a95c","observation_id":"2430febf-ee02-49cd-b57f-6ac84cc8b47f","resolution":{"observed_at":"2026-08-07T06:02:30.221368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.10286","last_updated":"2020-03-07T17:55:41Z","snapshot_observed_at":"2026-07-06T09:06:42.071993Z","submitted_at":"2020-03-07T17:55:41Z","title":"PathVQA: 30000+ Questions for Medical Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.10286","snapshot_observed_at":"2026-08-07T06:02:30.224674Z","title":"Pathvqa: 30000+ questions for medical visual question answering","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.224674Z"},"links":{"cited_paper":"/paper/2003.10286","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:cc1c9301316874ccb69258f038dd6e919bb5245f0b6e6f9e0f0cb8d9cbd31b82","observation_id":"209f2471-82e4-450e-8fe7-45bb600d254e","resolution":{"observed_at":"2026-08-07T06:02:30.224674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.228260Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.228260Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:f17f8d1b285bb6f951a7c4483b86f1ec326b41cccb930efdf6b0c221237ca4f6","observation_id":"669db1a4-b54e-49e4-8bfe-4d8b997731fb","resolution":{"observed_at":"2026-08-07T06:02:30.228260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.231512Z","title":"Koniq-10k: An ecologically valid database for deep learning of blind image quality assessment","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.231512Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:03ecc86eedfaae2911f916af60930e487215bea18e7152bb9f5f8658bf1fa16b","observation_id":"6ca98ae8-e705-436f-9692-368ec67430e2","resolution":{"observed_at":"2026-08-07T06:02:30.231512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12895","last_updated":"2024-03-19T16:48:40Z","snapshot_observed_at":"2026-08-07T02:52:27.054968Z","submitted_at":"2024-03-19T16:48:40Z","title":"mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12895","snapshot_observed_at":"2026-08-07T06:02:30.234729Z","title":"mplug-docowl 1.5: Unified structure learning for ocr-free document understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.234729Z"},"links":{"cited_paper":"/paper/2403.12895","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:393ec831980c8d035150ab66a35a1d317ee0f0ef3dbf2c18c0e14735e5151a2f","observation_id":"13ce348c-6f4e-4ff0-a75c-36eed2ec4bee","resolution":{"observed_at":"2026-08-07T06:02:30.234729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.238109Z","title":"Medical-diff-vqa: a large-scale medical dataset for difference visual question answering on chest x-ray images, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.238109Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:16e229ffea58e1c553cdd31333a0f42d30691f7dfcf54282e394b1cc11212ee2","observation_id":"8c75405c-2f20-4413-a079-1700b6a00b72","resolution":{"observed_at":"2026-08-07T06:02:30.238109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.241444Z","title":"Movienet: A holistic dataset for movie understanding","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.241444Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:8194d6ec12c08b26610e9563f41edeaeeb66f03e6358193653f5a4c80c6b7c64","observation_id":"beed86e7-8ef0-4c38-b874-721f76f683c1","resolution":{"observed_at":"2026-08-07T06:02:30.241444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.244739Z","title":"Icdar2019 competition on scanned receipt ocr and information extraction","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.244739Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:4c81c8d5abab6ed9ec3360ce63c0610450457c168465f2305356fa2ab9f54105","observation_id":"a3283491-6cde-4272-a8e9-6a8b47581690","resolution":{"observed_at":"2026-08-07T06:02:30.244739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.247942Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.247942Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:4f7847bd3536cca3543dc29e3cfc884493857ff6f444a4b38d220085c51b093e","observation_id":"4dfa8682-7aa0-4224-8ea3-1847b10f9a60","resolution":{"observed_at":"2026-08-07T06:02:30.247942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-08-07T06:02:30.251165Z","title":"Mantis: Interleaved multi-image instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.251165Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:dee813f7522a408d31041ef6834ac43e5c84babfda04cbd9af7d0b4fdcb058b4","observation_id":"174f77cd-8052-47e7-9770-9eba5b8372c6","resolution":{"observed_at":"2026-08-07T06:02:30.251165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.254523Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.254523Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:e1bafade5aead716f9298979b2c56d5184908a3e7fa611342a1060fa21600cdb","observation_id":"80d25d45-dc03-4fc4-a455-9dc0d7bf3c4c","resolution":{"observed_at":"2026-08-07T06:02:30.254523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.258111Z","title":"Dvqa: Understanding data visualizations via question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.258111Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:b0d7d67c81d1de2ac313ef65a00f22769861d7e6abc59cb0c49ec22501c95464","observation_id":"b5cdb447-51fa-47f8-a580-c592747f2c7e","resolution":{"observed_at":"2026-08-07T06:02:30.258111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.07300","last_updated":"2018-02-22T22:50:42Z","snapshot_observed_at":"2026-08-04T06:17:25.388464Z","submitted_at":"2017-10-19T18:01:38Z","title":"FigureQA: An Annotated Figure Dataset for Visual Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.07300","snapshot_observed_at":"2026-08-07T06:02:30.261341Z","title":"E., Michalski, V., Atkinson, A., K \\'a d \\'a r, \\'A ., Trischler, A., and Bengio, Y","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.261341Z"},"links":{"cited_paper":"/paper/1710.07300","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:71c593ec5b3e40b4b7792acdbe7d75748e34a3426bb99ee5d2f7f09491b7a5a7","observation_id":"d8be9ef5-2188-4f56-a41a-7957667c4179","resolution":{"observed_at":"2026-08-07T06:02:30.261341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06486","last_updated":"2022-04-14T15:41:15Z","snapshot_observed_at":"2026-07-06T12:47:09.813767Z","submitted_at":"2022-03-12T17:01:38Z","title":"Chart-to-Text: A Large-Scale Benchmark for Chart Summarization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.06486","snapshot_observed_at":"2026-08-07T06:02:30.264586Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.264586Z"},"links":{"cited_paper":"/paper/2203.06486","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:81f6759c15540505d178c8fa0c9117102b4f49ce6597b283c26fba8a42ed441c","observation_id":"c1474023-82b6-4b32-be90-265dbf797445","resolution":{"observed_at":"2026-08-07T06:02:30.264586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.268275Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.268275Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:a4583ea1263f4cf22b4a7e590d6a09047831cf181c5d0386d8f8f31cac90e2ec","observation_id":"8277c4b0-01fe-4f01-b02a-6ea0cf332505","resolution":{"observed_at":"2026-08-07T06:02:30.268275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.271379Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.271379Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:63d876ade3e63d3f5593aacf8f46a261be6aaec04bbe8f1251262904b81a719f","observation_id":"8f63e000-09da-4d75-827b-ff1de325a7e9","resolution":{"observed_at":"2026-08-07T06:02:30.271379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.274553Z","title":"Are you smarter than a sixth grader? textbook question answering for multimodal machine comprehension","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.274553Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:e7f2b6cf07fc209e09dddcf29db9e576a32a59a983bd5e607cee888f4ee9128f","observation_id":"f1cc699c-fcae-4550-87ec-cf8c16069995","resolution":{"observed_at":"2026-08-07T06:02:30.274553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.278069Z","title":"Visual information extraction in the wild: practical dataset and end-to-end solution","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.278069Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:f6d2d935d18b0845eb0f4ba9d4bb36be49747529b32512c32ff83a81989f65db","observation_id":"57ad395e-beeb-4c37-a87b-ed1205ca2522","resolution":{"observed_at":"2026-08-07T06:02:30.278069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.281255Z","title":"Laion-gpt4v dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.281255Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:f3a3aaf11465d0e9ad63262bf9fcd0d52fdfc0554b2e457791e2697473ab518e","observation_id":"810c6589-e670-4112-a806-0b314790c112","resolution":{"observed_at":"2026-08-07T06:02:30.281255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.284375Z","title":"J., Gayen, S., Ben Abacha, A., and Demner-Fushman, D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.284375Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:d68fd4bf1863040699f7cf5742fd47799f62b3e1f3eaac33e119ef4ba210d867","observation_id":"dfc59059-e7aa-4d95-a722-6d38b63e3d24","resolution":{"observed_at":"2026-08-07T06:02:30.284375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-07-06T18:09:29.876755Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-07T06:02:30.287592Z","title":"What matters when building vision-language models? arXiv preprint arXiv:2405.02246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.287592Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:bdffea31c7fea1579a830e8579735d345689e6e0707bc3ea6ef509cf1725e5e0","observation_id":"9a24351c-1ad4-46be-9297-e4b072587cfb","resolution":{"observed_at":"2026-08-07T06:02:30.287592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.290994Z","title":"G., and Lov \\'o n Melgarejo, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.290994Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:aed8dda4bcc6c27a833c773b03038b4702b0b9bae03d077533bb2adfd6bab7b6","observation_id":"cc7246f4-6e8f-4389-a348-e5da0dbb0458","resolution":{"observed_at":"2026-08-07T06:02:30.290994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.294273Z","title":"Chemvlm: Exploring the power of multimodal large language models in chemistry area","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.294273Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:d401eb2332918ce870248963ebe16cb68c53b333e850b2dbfcda4c1c9ef6f28f","observation_id":"36f591ec-7866-4929-8473-e3c6ff0d02ff","resolution":{"observed_at":"2026-08-07T06:02:30.294273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.297412Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.297412Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:6b509e6cfd0653802aecc649d5755a2880ef4c468472ce1b86fe8a9041aa8c22","observation_id":"9322a4e8-564e-40c4-a543-064dc566e5e2","resolution":{"observed_at":"2026-08-07T06:02:30.297412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.300577Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.300577Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:8593198de0540c86dddacaf58a9247e4efbccdf8349d83693e3795492c454137","observation_id":"dd1e125a-4572-4e4e-b84a-48a5cf860a21","resolution":{"observed_at":"2026-08-07T06:02:30.300577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.303815Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.303815Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:49337e5e7c52366c7e427d19e3e894617d051b3f4921dd8705f3ba38411d89c3","observation_id":"0efdde03-aabb-4c5e-9981-273822210940","resolution":{"observed_at":"2026-08-07T06:02:30.303815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.307014Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.307014Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:9cc2bbcfbe69e591e27ef773370f80e0fc51d3a4ec70d997aee0be9ff156905a","observation_id":"01704a5f-c125-49bc-881a-eb17e9f8b86c","resolution":{"observed_at":"2026-08-07T06:02:30.307014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.514606Z","title":"Slake: A semantically-labeled knowledge-enhanced dataset for medical visual question answering","venue":null,"work_id":"786ed2d1-09da-40a8-af16-4bc638778063","year":2021},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.310104Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:3147555ac4e8090388f80f78d6ce446c65a8afc69c4c41953ad2e49aed4d95a6","observation_id":"99dea663-00ac-46ea-babb-7b35d882486d","resolution":{"observed_at":"2026-08-07T06:02:31.518169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.503003Z","title":"Casia online and offline chinese handwriting databases","venue":null,"work_id":"0c99d457-1914-4119-86f8-d65f80365e8e","year":2011},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.313225Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:306fa7a2afaa9b210327d285bfdd720bca5b9a5cc100490c1dcc09454ff81c8f","observation_id":"b189077f-4b5e-4840-ad8e-bea1bbe31d7d","resolution":{"observed_at":"2026-08-07T06:02:31.506657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.491725Z","title":"Visual spatial reasoning","venue":null,"work_id":"9bb29477-c597-46e9-ae42-543b8afbac1d","year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.316435Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:3a22adac1169c03d99bed8a0e56ed0bd698655fce1cef6dc77a625590ccaef58","observation_id":"946e01d2-f093-45ca-a824-c0bf5ccc3cc5","resolution":{"observed_at":"2026-08-07T06:02:31.495266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.480317Z","title":"Mitigating hallucination in large multi-modal models via robust instruction tuning","venue":null,"work_id":"c52cabba-f43d-4703-b5fe-eae6f6916979","year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.319716Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:7b5b74a84b5865421480af0a293844862dd1bbd3087673bdfedd7381d1de1080","observation_id":"b07f0ca7-744d-4623-b1e8-e0f98c805451","resolution":{"observed_at":"2026-08-07T06:02:31.484152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10774","last_updated":"2024-04-15T15:48:48Z","snapshot_observed_at":"2026-07-06T16:49:13.099946Z","submitted_at":"2023-11-15T23:36:42Z","title":"MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10774","snapshot_observed_at":"2026-08-07T06:02:30.322925Z","title":"Mmc: Advancing multimodal chart understanding with large-scale instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.322925Z"},"links":{"cited_paper":"/paper/2311.10774","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:216423cf12c5deaa9b379d996a4883fca53b76bbaaa79c23936aa883d891aa17","observation_id":"17c71ad7-9f4f-4159-9ce9-1a6764bd694f","resolution":{"observed_at":"2026-08-07T06:02:30.322925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.326278Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.326278Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:644845afcfe27f27bc90090030b385c74cb9e92d9295e955e67f7ca0552510d6","observation_id":"f00e6b2e-9063-4c1a-8cd1-2a7c6a92d1a5","resolution":{"observed_at":"2026-08-07T06:02:30.326278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.329367Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.329367Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:9f7499140959b2f7677d30651ea31c7c72b4f3e50560423dc39f7a7831a76313","observation_id":"604930f5-0b88-4c59-95d0-1ee410d9de32","resolution":{"observed_at":"2026-08-07T06:02:30.329367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.332532Z","title":"F., Lin, K., Hewitt, J., Paranjape, A., Bevilacqua, M., Petroni, F., and Liang, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.332532Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:d14e00325b659e365cccae9ea416255f82761f85dd079c6ec96380f041a3846f","observation_id":"8546b904-8a57-41ab-a652-42fed20649b7","resolution":{"observed_at":"2026-08-07T06:02:30.332532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.445353Z","title":"Paying more attention to image: A training-free method for alleviating hallucination in lvlms","venue":null,"work_id":"38b0c047-7353-48be-b84d-23ba801100ea","year":2025},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.335865Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:a22a9003a03b4b509d7466cc9439dfefa4e6ea9b2691928e9ea2239a5eebcf03","observation_id":"90241c51-b471-4207-a6b0-416a39b7b9e8","resolution":{"observed_at":"2026-08-07T06:02:31.449278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.339582Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pp.\\ 216--233","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.339582Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:b4b797ad3d8e3fb285a0fc4c2cc6d9c170922199f95c3cbfcf8e42be5590760d","observation_id":"733505ed-4a4d-490f-9430-7783d7a73374","resolution":{"observed_at":"2026-08-07T06:02:30.339582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11833","last_updated":"2024-10-29T12:34:11Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:47Z","title":"MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11833","snapshot_observed_at":"2026-08-07T06:02:30.346839Z","title":"Mmdu: A multi-turn multi-image dialog understanding benchmark and instruction-tuning dataset for lvlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.346839Z"},"links":{"cited_paper":"/paper/2406.11833","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:008a44cb6a989097e83fea0ed13fece3484e0b5a289540dae345a3d4abaa45e0","observation_id":"5695cc77-06fc-4aca-a66e-e9a988521821","resolution":{"observed_at":"2026-08-07T06:02:30.346839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04165","last_updated":"2021-07-20T23:22:27Z","snapshot_observed_at":"2026-08-06T13:29:31.050456Z","submitted_at":"2021-05-10T07:46:55Z","title":"Inter-GPS: Interpretable Geometry Problem Solving with Formal Language and Symbolic Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04165","snapshot_observed_at":"2026-08-07T06:02:30.350057Z","title":"Inter-gps: Interpretable geometry problem solving with formal language and symbolic reasoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.350057Z"},"links":{"cited_paper":"/paper/2105.04165","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:898d0828872a9cf51e86b8a4b14d9ff1807b5ed738197534ce27ac12a3b547de","observation_id":"e3b3ff6b-8025-4c8a-98d7-14cdf5e688b2","resolution":{"observed_at":"2026-08-07T06:02:30.350057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.425713Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"ae537505-d0ce-4411-87db-8db680d54728","year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.353502Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:4ad7a50591afc6c07528605d6050757e62a158c5e2f1569adaff123a4f107cc8","observation_id":"6e92e147-407f-4e5b-8b8f-1e49ef1e8d61","resolution":{"observed_at":"2026-08-07T06:02:31.429290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-07T02:52:46.435647Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-07T06:02:30.357233Z","title":"N., Zhu, S.-C., Rajpurohit, T., Clark, P., and Kalyan, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.357233Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:ac4559e68dc9fc80391273f741e3bfec0f9888eee5672abef654053f3720f7be","observation_id":"4f30c604-bac2-41b0-9774-f0e2832b62cd","resolution":{"observed_at":"2026-08-07T06:02:30.357233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T06:02:30.361051Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.361051Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:415905b95ae97c8e38637d5ac3491b8f67259b6685c65e379b8ddb6859eb2869","observation_id":"156f6993-0a26-418b-bb6f-867c05b90e02","resolution":{"observed_at":"2026-08-07T06:02:30.361051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.414662Z","title":"Deepart: Learning joint representations of visual arts","venue":null,"work_id":"9935870a-01de-4115-8d5d-de5230746172","year":2017},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.364523Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:24078ad1e9c2a91b24adf6a8418495b632cf7229583907682d06ae7b711493c4","observation_id":"f661c154-e39b-42b0-980a-4f0457f3041a","resolution":{"observed_at":"2026-08-07T06:02:31.418177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.402410Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"f3185ee2-ad9e-4dec-ac08-c398190e3032","year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.367657Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:afb0a03231bcf5e9a5cf5f2a14a37bd114a513defe23286684bdc4ba9957c0d5","observation_id":"c77c4483-ffa4-4447-b75b-c3042ff0f6a1","resolution":{"observed_at":"2026-08-07T06:02:31.406702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.390637Z","title":"and Bunke, H","venue":null,"work_id":"a02934d4-d6cc-4f9c-a227-16d33eb5aae2","year":2002},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.370785Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:b922c433676f5017287df4631e681364de84d439a41c0683d75b2f5311c648b1","observation_id":"dfa4350b-4f3c-46ca-9875-93bcd26166eb","resolution":{"observed_at":"2026-08-07T06:02:31.394019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.379221Z","title":"L., Tan, J","venue":null,"work_id":"5c5acaea-ee4c-4f17-9b24-0114d5128ce0","year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.374097Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:49052a6e4b6fc075de7fe2a47e2c7087eb17b30edd695e489b1ce45572295e1c","observation_id":"18c6213e-1545-47cb-916a-ab4fe68274be","resolution":{"observed_at":"2026-08-07T06:02:31.382660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-07T06:02:30.377251Z","title":"X., Tan, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.377251Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:5b23e6536c35f8c047d61c93539db834156ab1558cce8eca1706b525fa71143f","observation_id":"137e982f-9a0d-49a5-8a9e-134d0c8a0659","resolution":{"observed_at":"2026-08-07T06:02:30.377251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14761","last_updated":"2023-10-10T23:39:25Z","snapshot_observed_at":"2026-08-03T20:34:57.164411Z","submitted_at":"2023-05-24T06:11:17Z","title":"UniChart: A Universal Vision-language Pretrained Model for Chart Comprehension and Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14761","snapshot_observed_at":"2026-08-07T06:02:30.380654Z","title":"L., Hoque, E., and Joty, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.380654Z"},"links":{"cited_paper":"/paper/2305.14761","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:2dbb5324e4fb99efc8134706bece4cebfbcda34350300af25c75bdd44c96725e","observation_id":"be2f4648-53c9-4e91-8ab0-fc059295805c","resolution":{"observed_at":"2026-08-07T06:02:30.380654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.367846Z","title":"Infographicvqa","venue":null,"work_id":"621cff0e-0ab4-413f-8c3c-5d095b13bebc","year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.384119Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:0da79ee40d1b6c5fc0aac5ec4acd33c8d9915d3e2494b5f48063800a0f38b822","observation_id":"e6bcc7c4-897b-429b-ad41-109aa8beff90","resolution":{"observed_at":"2026-08-07T06:02:31.371284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.356383Z","title":"M., and Kumar, P","venue":null,"work_id":"d6c8671f-ad58-4a5a-8944-8b3472f605e7","year":2020},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.387472Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:bb98f556c68ce0deddd772c0d8a5eaabd7e638f2c3e67f6ec1c9554b3a69a203","observation_id":"9ff00e35-d786-456c-8814-5f0078660c84","resolution":{"observed_at":"2026-08-07T06:02:31.360029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.344998Z","title":"Opengvlab/internvl-chat-v1-2-sft-data, Jan 2024","venue":null,"work_id":"9c0f117a-7bc8-43ca-aa5a-df41b06cd9fb","year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.391046Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:336d56119f0668cfd76bbfcd23fae9029f85a7e5f193e37028c4fc1a8e8aed07","observation_id":"3ecfc09d-1ebb-4353-a622-1da18e7a13fe","resolution":{"observed_at":"2026-08-07T06:02:31.348665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.394227Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.394227Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:d7f3ada720c16a0660429c0d5615c2c45c89d096fa34bb43f9d7cb6d82bc5226","observation_id":"63479621-6e1a-4838-8694-93568d5fa6e7","resolution":{"observed_at":"2026-08-07T06:02:30.394227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-07T06:02:30.397502Z","title":"Kosmos-2: Grounding multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.397502Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:e00cf1a8d867591028f0d480bba883a16ee1831faae1532728055eac11f06351","observation_id":"0c1e3acc-6270-4b13-aa75-e1b031b50306","resolution":{"observed_at":"2026-08-07T06:02:30.397502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.326123Z","title":"A., Wang, L., Cervantes, C","venue":null,"work_id":"91a87fe3-e19e-4f3e-b10f-0cad9b2da27c","year":2015},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.400986Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:e67fa93062032f090ff8bc52eb61a10a082b1897c92930a83fdf14a67ee548e4","observation_id":"01a410e3-8cf4-4fae-b973-5d36686e14b5","resolution":{"observed_at":"2026-08-07T06:02:31.329398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.315097Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"df4f3d23-11b9-4d3c-8647-3bda54a528eb","year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.404242Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:222be8e063c9e7dd171f490f8db88555569f1a2146f506161ed22bed10f906ce","observation_id":"1cc2ab6b-5754-4d27-8241-182a2418c82a","resolution":{"observed_at":"2026-08-07T06:02:31.318852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.304208Z","title":"Laion coco: 600m synthetic captions from laion2b-en","venue":null,"work_id":"df241a70-6744-407d-8854-792d01f8e648","year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.407507Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:02e68b89b806f1d923dd188987ea9afab74915d695aac57dc27cf205cc2b7fc4","observation_id":"bb4b8522-8214-418c-a2ff-1c533289bb58","resolution":{"observed_at":"2026-08-07T06:02:31.307704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.293234Z","title":"Solving geometry problems: Combining text and diagram interpretation","venue":null,"work_id":"3f650c38-6204-4690-bac3-39521c79aadb","year":2015},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.410789Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:198d322a99e7b35f91091bf18713e30fe80fc4d7672cea462f87457e4ea753d1","observation_id":"1b84a50c-ef90-4ba9-bdef-b3783f87e3ad","resolution":{"observed_at":"2026-08-07T06:02:31.296729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.282314Z","title":null,"venue":null,"work_id":"374a4802-02a6-4776-b3ae-27e4ec3e6110","year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.414053Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:22f1df7b91ac51cf0cb68d522ff7c293303fe9fba92e0990e582efdf35bdb0aa","observation_id":"fbe9a7b8-59c9-41b3-99d9-a4dfb01ad904","resolution":{"observed_at":"2026-08-07T06:02:31.285582Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.271535Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":"02bad084-ce26-4590-8f32-3bbd86677e09","year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.417252Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:964f867360668384088712ffba8f2bcc660b6a03b4cd2efaa7c333fb27afce45","observation_id":"1a3ad93e-ed8e-4a09-9d05-0bf9b7515aec","resolution":{"observed_at":"2026-08-07T06:02:31.274988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.260932Z","title":"Towards vqa models that can read","venue":null,"work_id":"b45a31dc-17d0-4c97-bb1d-1faaab5b5232","year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.420406Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:c018fd78564b5f55f937c63ef648360d6e3c8c2e2f45e6bce34a90989cf8e30e","observation_id":"0a2e401d-22de-4408-b203-8ce576a0d7e5","resolution":{"observed_at":"2026-08-07T06:02:31.264334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.248893Z","title":"Towards vqa models that can read","venue":null,"work_id":"665a23f0-d566-497e-8760-b8c933a9554a","year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.423527Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:b58669dd67703c9a8de169169b4dd07bb8413eed35bf0cbdcb87249d6bc4f1b2","observation_id":"be159f74-34f0-4efd-9ca0-9bfb09e11a71","resolution":{"observed_at":"2026-08-07T06:02:31.252411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.237712Z","title":"Textocr: Towards large-scale end-to-end reasoning for arbitrary-shaped scene text","venue":null,"work_id":"1e170b86-1dc7-4853-b58e-510f8b96b9dd","year":2021},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.426830Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:90b3da5f10392823dc4b68a77151c7b1f47ec6e17c491b6c4030023a5a66e702","observation_id":"3179f98c-0cf1-44ad-ab44-ee10b2d0dbce","resolution":{"observed_at":"2026-08-07T06:02:31.241606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18532","last_updated":"2024-05-15T05:43:30Z","snapshot_observed_at":"2026-08-04T01:28:52.686106Z","submitted_at":"2024-04-29T09:19:05Z","title":"MileBench: Benchmarking MLLMs in Long Context","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18532","snapshot_observed_at":"2026-08-07T06:02:30.430076Z","title":"H., Yu, F., Wan, X., and Wang, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.430076Z"},"links":{"cited_paper":"/paper/2404.18532","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:5530b5963144bef6904bd8909b0bb65ddbda6e4f0663b017f0464f9947209e14","observation_id":"d554ce3f-0191-4126-aca7-caf3d993cddc","resolution":{"observed_at":"2026-08-07T06:02:30.430076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.226252Z","title":"Transformer roadmap: 2","venue":null,"work_id":"a79c7634-60c8-4f65-84b9-9585b740b716","year":2021},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.433564Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:213b2d011dceb9acfb27acc1c74b37994ad2941859d03c60728aabe3d24496dd","observation_id":"15374b95-0c4e-410f-af9a-b0853b967627","resolution":{"observed_at":"2026-08-07T06:02:31.229796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.215251Z","title":"C., Han, J., Ding, E., Liu, J., Karatzas, D., et al","venue":null,"work_id":"646abf04-20e8-47b1-9e8a-81394cbfd009","year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.436705Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:eaf010b5c6088ad98af87938d9539865d9f8701de8cfea215b956be1d46bc24f","observation_id":"9d98cf6c-e5e3-4c5c-980b-b5d1a4852d4f","resolution":{"observed_at":"2026-08-07T06:02:31.218537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.204213Z","title":"Internvl2: Better than the best—expanding performance boundaries of open-source multimodal models with the progressive scaling strategy, 2024","venue":null,"work_id":"eeec05a5-d758-4042-bbd9-3e80035b41dd","year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.439836Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:e081977a5b54bc2be4dad4b382a0c0cf00a162441c3dc370f1fae955a3de7c0d","observation_id":"18ec7216-01ed-42d5-85ed-341a4c6cd833","resolution":{"observed_at":"2026-08-07T06:02:31.207757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T06:02:30.444417Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.444417Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:b69fefa99016a2e42741a8007ee044807dd8239f6b32986c1fdcdc0f9c5003c0","observation_id":"295ed525-12db-4af6-bcb7-6dfc706f61ef","resolution":{"observed_at":"2026-08-07T06:02:30.444417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-08-07T06:02:30.447765Z","title":"Coco-text: Dataset and benchmark for text detection and recognition in natural images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.447765Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:b336ea267c47e6bd1f9a3fe15e2a56ab06f3f8099ac32ae3e3057ce7b7c5dcbb","observation_id":"a1f5b464-6f14-461f-aedd-9d6cbb42dc60","resolution":{"observed_at":"2026-08-07T06:02:30.447765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.193178Z","title":"V3det: Vast vocabulary visual detection dataset","venue":null,"work_id":"ddab95d8-3c16-4f06-b5de-8dfc263883e0","year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.451246Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:99ccff8c93303f68ad9b9495838c70b4b5bdb4437d5b33ac60d963e077270bb7","observation_id":"9f93a81d-03ac-4199-8d57-73741ee9121c","resolution":{"observed_at":"2026-08-07T06:02:31.196589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14804","last_updated":"2024-02-22T18:56:38Z","snapshot_observed_at":"2026-08-06T04:41:26.667478Z","submitted_at":"2024-02-22T18:56:38Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14804","snapshot_observed_at":"2026-08-07T06:02:30.454664Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.454664Z"},"links":{"cited_paper":"/paper/2402.14804","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:966198d466cb5bbef09ade2c3023158cfc26a8e191fad8b5c52133d028fc26c6","observation_id":"ae545fb5-9c31-4421-9b57-625e6aeba795","resolution":{"observed_at":"2026-08-07T06:02:30.454664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T06:02:30.458205Z","title":"Qwen2-vl: Enhancing vision-language model's perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.458205Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:204198576d9d00026ddb711665905d20383ae7a66f3b6038195483718570e3da","observation_id":"6c69544c-f78e-4907-bb82-9e20ca304583","resolution":{"observed_at":"2026-08-07T06:02:30.458205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01907","last_updated":"2023-08-03T17:59:47Z","snapshot_observed_at":"2026-07-06T16:02:15.266899Z","submitted_at":"2023-08-03T17:59:47Z","title":"The All-Seeing Project: Towards Panoptic Visual Recognition and Understanding of the Open World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01907","snapshot_observed_at":"2026-08-07T06:02:30.461439Z","title":"The all-seeing project: Towards panoptic visual recognition and understanding of the open world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.461439Z"},"links":{"cited_paper":"/paper/2308.01907","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:82281658ad96a140db37b366ff2f2b5bff8cd24e54cdfb566a88dc8900348562","observation_id":"74ab545b-117c-4047-824a-57ee643cddd5","resolution":{"observed_at":"2026-08-07T06:02:30.461439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07230","last_updated":"2024-10-09T07:46:02Z","snapshot_observed_at":"2026-07-06T18:28:51.180903Z","submitted_at":"2024-06-11T13:09:16Z","title":"Needle In A Multimodal Haystack","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07230","snapshot_observed_at":"2026-08-07T06:02:30.464875Z","title":"Needle in a multimodal haystack","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.464875Z"},"links":{"cited_paper":"/paper/2406.07230","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:2ce9deed26ddca623ff72a60711d4339f3c658af0d89477ccfec27b597032e0d","observation_id":"4f7dfd5e-5b7a-4f5b-90cb-ac18b352031d","resolution":{"observed_at":"2026-08-07T06:02:30.464875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.181035Z","title":"C., Luo, C., Jin, L., Chan, C","venue":null,"work_id":"091b5e9a-4942-4046-9005-170fbf9c781b","year":2020},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.468386Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:ea0249430057d14bbebbd64ca73e7274d0a09d2dc8510a0374ada56e1aa841ef","observation_id":"60177022-5d53-47f2-baf6-075177bef644","resolution":{"observed_at":"2026-08-07T06:02:31.184921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":74,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":114},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 114 outbound references and 2 inbound Pith citation observations for arXiv:2506.06279."}