{"as_of":"2026-08-10T00:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0dbab630f37daa0e4ba152cb756ee6d09a8a1ba6fb63ad2ee23e902ae094e20e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":7,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":7,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:08:08.450760Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T06:39:37.507046Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.20550","last_updated":"2024-04-05T05:29:29Z","snapshot_observed_at":"2026-07-06T16:41:11.586802Z","submitted_at":"2023-10-31T15:31:39Z","title":"CapsFusion: Rethinking Image-Text Data at Scale","version":3},"cited_work":{"arxiv_id":"2310.20550","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20550","snapshot_observed_at":"2026-07-04T06:39:37.507046Z","title":"Capsfusion: Rethinking image-text data at scale","venue":null,"work_id":"74c6af5e-21d8-426b-bf6d-91f2049fc16f","year":2023},"citing_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-11T17:58:54.177359Z"},"links":{"cited_paper":"/paper/2310.20550","citing_paper":"/paper/2403.05525"},"observation_digest":"sha256:c45a0ace8479581c8d1b4f295273bf0b3ec022423800bfb1540402cf1b253df7","observation_id":"b687545a-f19e-447e-9c3a-50662f4f4cad","resolution":{"observed_at":"2026-05-11T17:58:54.751043Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20550","last_updated":"2024-04-05T05:29:29Z","snapshot_observed_at":"2026-07-06T16:41:11.586802Z","submitted_at":"2023-10-31T15:31:39Z","title":"CapsFusion: Rethinking Image-Text Data at Scale","version":3},"cited_work":{"arxiv_id":"2310.20550","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20550","snapshot_observed_at":"2026-07-04T06:39:37.507046Z","title":"Capsfusion: Rethinking image-text data at scale","venue":null,"work_id":"74c6af5e-21d8-426b-bf6d-91f2049fc16f","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2310.20550","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:937a5e6fba5becdc40ed8e26a42c402762eae323ccbcea4ddd0dc09fc09b94f9","observation_id":"2b097277-fe44-431b-a487-4ff794e18289","resolution":{"observed_at":"2026-05-15T22:48:36.115040Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20550","last_updated":"2024-04-05T05:29:29Z","snapshot_observed_at":"2026-07-06T16:41:11.586802Z","submitted_at":"2023-10-31T15:31:39Z","title":"CapsFusion: Rethinking Image-Text Data at Scale","version":3},"cited_work":{"arxiv_id":"2310.20550","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20550","snapshot_observed_at":"2026-07-04T06:39:37.507046Z","title":"Capsfusion: Rethinking image-text data at scale","venue":null,"work_id":"74c6af5e-21d8-426b-bf6d-91f2049fc16f","year":2023},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"cited_paper":"/paper/2310.20550","citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:c371a41d83601cc70cbd01c2a0ccdfb080d07493bdac2607704de61ee61f5900","observation_id":"a7276b04-4dc2-40a0-9297-790122fa7487","resolution":{"observed_at":"2026-05-16T14:58:37.488355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20550","last_updated":"2024-04-05T05:29:29Z","snapshot_observed_at":"2026-07-06T16:41:11.586802Z","submitted_at":"2023-10-31T15:31:39Z","title":"CapsFusion: Rethinking Image-Text Data at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20550","snapshot_observed_at":"2026-08-07T13:08:08.450760Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:08.450760Z"},"links":{"cited_paper":"/paper/2310.20550","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:f4053b5d8765c3514ceda6875bbbbbb56bf60ac87bbfbe33cbe9198d33f7608d","observation_id":"282cb1db-1d9d-4e8f-86a7-92e62621b0dd","resolution":{"observed_at":"2026-08-07T13:08:08.450760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20550","last_updated":"2024-04-05T05:29:29Z","snapshot_observed_at":"2026-07-06T16:41:11.586802Z","submitted_at":"2023-10-31T15:31:39Z","title":"CapsFusion: Rethinking Image-Text Data at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20550","snapshot_observed_at":"2026-08-06T11:46:45.543788Z","title":"Caps- fusion: Rethinking image-text data at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.543788Z"},"links":{"cited_paper":"/paper/2310.20550","citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:9f110ea1acc25ae6cedca0ede0a9c42efd1616946b8d53c22701092109690f46","observation_id":"85b5c121-2c3c-4e77-9e74-d93c9127a5d4","resolution":{"observed_at":"2026-08-06T11:46:45.543788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20550","last_updated":"2024-04-05T05:29:29Z","snapshot_observed_at":"2026-07-06T16:41:11.586802Z","submitted_at":"2023-10-31T15:31:39Z","title":"CapsFusion: Rethinking Image-Text Data at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20550","snapshot_observed_at":"2026-08-03T08:15:36.678781Z","title":"Capsfusion: Rethinking image-text data at scale, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.17717","last_updated":"2026-06-09T20:25:14Z","snapshot_observed_at":"2026-08-08T23:34:38.789355Z","submitted_at":"2026-01-25T06:40:25Z","title":"A Survey on Evaluating Quality and Trustworthiness in LLM-Generated Data","version":3},"reference_index":259,"source":"arxiv_source","source_observed_at":"2026-08-03T08:15:36.678781Z"},"links":{"cited_paper":"/paper/2310.20550","citing_paper":"/paper/2601.17717"},"observation_digest":"sha256:bcdf6a615c5ea07385216a37aed4ea4de785acd7b5cce03272f7af0dd9680558","observation_id":"3191fa67-74b5-4f33-b0bd-8457f0ec7b40","resolution":{"observed_at":"2026-08-03T08:15:36.678781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20550","last_updated":"2024-04-05T05:29:29Z","snapshot_observed_at":"2026-07-06T16:41:11.586802Z","submitted_at":"2023-10-31T15:31:39Z","title":"CapsFusion: Rethinking Image-Text Data at Scale","version":3},"cited_work":{"arxiv_id":"2310.20550","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20550","snapshot_observed_at":"2026-07-04T06:39:37.507046Z","title":"Capsfusion: Rethinking image-text data at scale","venue":null,"work_id":"74c6af5e-21d8-426b-bf6d-91f2049fc16f","year":2023},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-08-05T18:05:51.515234Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":250,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2310.20550","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:86b2b81e3e1eea428d5a810cc4cb09b6e46e235ea32400bb312771944d18eed2","observation_id":"b3543965-c233-40b3-83c7-965407277f72","resolution":{"observed_at":"2026-07-04T06:39:37.508435Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2310.20550/citation-record","integrity":"/paper/2310.20550/integrity","json":"/paper/2310.20550/citation-record.json","paper":"/paper/2310.20550"},"outbound":[],"paper":{"arxiv_id":"2310.20550","last_updated":"2024-04-05T05:29:29Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T16:41:11.586802Z","submitted_at":"2023-10-31T15:31:39Z","title":"CapsFusion: Rethinking Image-Text Data at Scale"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 7 inbound Pith citation observations for arXiv:2310.20550."}