{"as_of":"2026-08-04T23:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:05678fab02a278a8ab291bf876b217dcaa5e7aa9540cbd400ddf9f9499ed516d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T10:00:10.824477Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-10T06:15:00.866473Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.09733","last_updated":"2024-10-13T05:35:09Z","snapshot_observed_at":"2026-08-02T08:33:00.410905Z","submitted_at":"2024-10-13T05:35:09Z","title":"MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2410.09733","doi":"10.48550/arxiv.2410.09733","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.09733","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mmcomposition: Revisiting the compositionality of pre-trained vision-language models.arXiv preprint arXiv:2410.09733","venue":null,"work_id":"64ab49b6-a318-4f74-bc22-72975a306c6b","year":2024},"citing_paper":{"arxiv_id":"2504.21850","last_updated":"2026-05-14T18:32:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-30T17:57:22Z","title":"Visual Compositional Tuning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:09.890605Z"},"links":{"cited_paper":"/paper/2410.09733","citing_paper":"/paper/2504.21850"},"observation_digest":"sha256:eca1d8d6026bfe09545b825328a951e84ab1e8868dce5387e18c219946f6675a","observation_id":"72696188-7aeb-4108-aa46-b636a46f7385","resolution":{"observed_at":"2026-05-22T17:41:53.105066Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09733","last_updated":"2024-10-13T05:35:09Z","snapshot_observed_at":"2026-08-02T08:33:00.410905Z","submitted_at":"2024-10-13T05:35:09Z","title":"MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2410.09733","doi":"10.48550/arxiv.2410.09733","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.09733","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mmcomposition: Revisiting the compositionality of pre-trained vision-language models.arXiv preprint arXiv:2410.09733","venue":null,"work_id":"64ab49b6-a318-4f74-bc22-72975a306c6b","year":2024},"citing_paper":{"arxiv_id":"2603.27064","last_updated":"2026-04-14T20:08:27Z","snapshot_observed_at":"2026-07-06T22:50:50.593464Z","submitted_at":"2026-03-28T00:45:05Z","title":"ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-14T22:39:06.113655Z"},"links":{"cited_paper":"/paper/2410.09733","citing_paper":"/paper/2603.27064"},"observation_digest":"sha256:ea18cf7b78e61b22b96fd34017d77f3c9a1b888ec74c5eb91ee01ca734037f08","observation_id":"eca0d95a-d76d-416e-bf40-aa99013712fe","resolution":{"observed_at":"2026-05-14T22:39:32.954917Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09733","last_updated":"2024-10-13T05:35:09Z","snapshot_observed_at":"2026-08-02T08:33:00.410905Z","submitted_at":"2024-10-13T05:35:09Z","title":"MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2410.09733","doi":"10.48550/arxiv.2410.09733","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.09733","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mmcomposition: Revisiting the compositionality of pre-trained vision-language models.arXiv preprint arXiv:2410.09733","venue":null,"work_id":"64ab49b6-a318-4f74-bc22-72975a306c6b","year":2024},"citing_paper":{"arxiv_id":"2605.18652","last_updated":"2026-05-18T16:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-18T16:57:36Z","title":"MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:36.734758Z"},"links":{"cited_paper":"/paper/2410.09733","citing_paper":"/paper/2605.18652"},"observation_digest":"sha256:ab5ab3c06bc492652a008e9fa9cea83da42f54d238f98a305a7b20802d065491","observation_id":"27372a24-07a9-4c29-9881-909e16265e62","resolution":{"observed_at":"2026-05-20T11:58:14.947470Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09733","last_updated":"2024-10-13T05:35:09Z","snapshot_observed_at":"2026-08-02T08:33:00.410905Z","submitted_at":"2024-10-13T05:35:09Z","title":"MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2410.09733","doi":"10.48550/arxiv.2410.09733","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.09733","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mmcomposition: Revisiting the compositionality of pre-trained vision-language models.arXiv preprint arXiv:2410.09733","venue":null,"work_id":"64ab49b6-a318-4f74-bc22-72975a306c6b","year":2024},"citing_paper":{"arxiv_id":"2606.01414","last_updated":"2026-05-31T19:22:43Z","snapshot_observed_at":"2026-07-06T23:41:58.121923Z","submitted_at":"2026-05-31T19:22:43Z","title":"Agent Skills Should Go Beyond Text: The Case for Visual Skills","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T17:11:37.457810Z"},"links":{"cited_paper":"/paper/2410.09733","citing_paper":"/paper/2606.01414"},"observation_digest":"sha256:001b57314cadf9e0a4ee9a7423d66d49fa1dc4be8d1abc300ebacf540f1cc986","observation_id":"94c3e4ce-b0ce-468f-a1b9-62f70045d21c","resolution":{"observed_at":"2026-06-28T17:12:23.895716Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09733","last_updated":"2024-10-13T05:35:09Z","snapshot_observed_at":"2026-08-02T08:33:00.410905Z","submitted_at":"2024-10-13T05:35:09Z","title":"MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2410.09733","doi":"10.48550/arxiv.2410.09733","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.09733","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mmcomposition: Revisiting the compositionality of pre-trained vision-language models.arXiv preprint arXiv:2410.09733","venue":null,"work_id":"64ab49b6-a318-4f74-bc22-72975a306c6b","year":2024},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-02T10:00:07.442935Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T02:03:45.564122Z"},"links":{"cited_paper":"/paper/2410.09733","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:1a5a7ec27847cc3c21ce21b1af0f5e501bb77ce171fee064dd7a28103c068803","observation_id":"026b55e2-a04a-44d3-be46-718b85d65819","resolution":{"observed_at":"2026-07-01T18:25:57.789709Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09733","last_updated":"2024-10-13T05:35:09Z","snapshot_observed_at":"2026-08-02T08:33:00.410905Z","submitted_at":"2024-10-13T05:35:09Z","title":"MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2410.09733","doi":"10.48550/arxiv.2410.09733","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.09733","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mmcomposition: Revisiting the compositionality of pre-trained vision-language models.arXiv preprint arXiv:2410.09733","venue":null,"work_id":"64ab49b6-a318-4f74-bc22-72975a306c6b","year":2024},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-02T10:00:07.442935Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-01T06:25:58.872140Z"},"links":{"cited_paper":"/paper/2410.09733","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:b57708a963623baf8059f92013bde77c646df907fb4a7f5bd798a660caa300d2","observation_id":"30318801-6c61-45bb-a607-f13110a5bcf6","resolution":{"observed_at":"2026-07-01T09:35:40.670430Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09733","last_updated":"2024-10-13T05:35:09Z","snapshot_observed_at":"2026-08-02T08:33:00.410905Z","submitted_at":"2024-10-13T05:35:09Z","title":"MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2410.09733","doi":"10.48550/arxiv.2410.09733","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.09733","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mmcomposition: Revisiting the compositionality of pre-trained vision-language models.arXiv preprint arXiv:2410.09733","venue":null,"work_id":"64ab49b6-a318-4f74-bc22-72975a306c6b","year":2024},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-02T10:00:07.442935Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-02T20:52:28.444524Z"},"links":{"cited_paper":"/paper/2410.09733","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:67677473600ca8eaa7da259f37ed198bdf2add4eda4e844cbe0ef414a119d6df","observation_id":"7104efbb-ce55-4f2d-ab61-b9bca81830da","resolution":{"observed_at":"2026-07-02T20:57:22.793660Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09733","last_updated":"2024-10-13T05:35:09Z","snapshot_observed_at":"2026-08-02T08:33:00.410905Z","submitted_at":"2024-10-13T05:35:09Z","title":"MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2410.09733","doi":"10.48550/arxiv.2410.09733","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.09733","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mmcomposition: Revisiting the compositionality of pre-trained vision-language models.arXiv preprint arXiv:2410.09733","venue":null,"work_id":"64ab49b6-a318-4f74-bc22-72975a306c6b","year":2024},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-02T10:00:07.442935Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-03T22:44:16.272541Z"},"links":{"cited_paper":"/paper/2410.09733","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:7d3f604dff28bc7302309e4c5fe096e8306a4d2005ca591e2ad4740244da353b","observation_id":"4aafa573-09b4-42ca-982f-898331afc419","resolution":{"observed_at":"2026-07-03T22:49:00.915059Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09733","last_updated":"2024-10-13T05:35:09Z","snapshot_observed_at":"2026-08-02T08:33:00.410905Z","submitted_at":"2024-10-13T05:35:09Z","title":"MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09733","snapshot_observed_at":"2026-07-14T17:14:19.770867Z","title":"arXiv preprint arXiv:2410.09733 (2024) 8","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-02T10:00:07.442935Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T17:14:19.770867Z"},"links":{"cited_paper":"/paper/2410.09733","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:fe52eeb69ee3c9d9c808161342fd5d38b259a487bcacdd639012d439ee5f1784","observation_id":"00aa0689-4103-4c6e-891b-8480f87b4465","resolution":{"observed_at":"2026-07-14T17:14:19.770867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09733","last_updated":"2024-10-13T05:35:09Z","snapshot_observed_at":"2026-08-02T08:33:00.410905Z","submitted_at":"2024-10-13T05:35:09Z","title":"MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09733","snapshot_observed_at":"2026-08-02T10:00:10.824477Z","title":"arXiv preprint arXiv:2410.09733 (2024) 8","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-02T10:00:07.442935Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":6},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T10:00:10.824477Z"},"links":{"cited_paper":"/paper/2410.09733","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:46665e085a5a4d070c6afb72f6dae5977583d1d24525154dffb805b386ce438d","observation_id":"84daaa27-8626-4168-b9ee-cc3c1c2e9e5e","resolution":{"observed_at":"2026-08-02T10:00:10.824477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09733","last_updated":"2024-10-13T05:35:09Z","snapshot_observed_at":"2026-08-02T08:33:00.410905Z","submitted_at":"2024-10-13T05:35:09Z","title":"MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2410.09733","doi":"10.48550/arxiv.2410.09733","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.09733","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mmcomposition: Revisiting the compositionality of pre-trained vision-language models.arXiv preprint arXiv:2410.09733","venue":null,"work_id":"64ab49b6-a318-4f74-bc22-72975a306c6b","year":2024},"citing_paper":{"arxiv_id":"2607.00374","last_updated":"2026-07-01T03:20:06Z","snapshot_observed_at":"2026-08-02T05:22:20.358970Z","submitted_at":"2026-07-01T03:20:06Z","title":"Learning to Compose: Revisiting Proxy Task Design for Zero-Shot Composed Image Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-02T15:11:57.228949Z"},"links":{"cited_paper":"/paper/2410.09733","citing_paper":"/paper/2607.00374"},"observation_digest":"sha256:f4caac40988d43fc9b4754bb13bacd93288f8ebc609f39326997f215062d32f8","observation_id":"42c656a9-cb30-441c-9236-974d2d20ed31","resolution":{"observed_at":"2026-07-02T15:17:07.310166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2410.09733/citation-record","integrity":"/paper/2410.09733/integrity","json":"/paper/2410.09733/citation-record.json","paper":"/paper/2410.09733"},"outbound":[],"paper":{"arxiv_id":"2410.09733","last_updated":"2024-10-13T05:35:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T08:33:00.410905Z","submitted_at":"2024-10-13T05:35:09Z","title":"MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2410.09733."}