{"as_of":"2026-08-07T20:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eaecca085987eb887219f3e5e2ccea0a8f84f9482c3bcccfa0971c8afdaa1118","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:09:56.862819Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T13:23:28.438005Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":"2406.10328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-06-29T13:23:28.438005Z","title":"From pixels to prose: A large dataset of dense image cap- tions","venue":null,"work_id":"aeacb482-3a4d-4073-865a-d41ff1e7d1d3","year":2024},"citing_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-15T22:09:16.001309Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2410.13848"},"observation_digest":"sha256:b1e01e42d21e4c4831c82f0a7328c2e23e390c7d4301b30ed61b51824849c31c","observation_id":"d15b7e7e-f44d-4dd6-9422-b149b8c24e0a","resolution":{"observed_at":"2026-05-15T22:09:16.246786Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":"2406.10328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-06-29T13:23:28.438005Z","title":"From pixels to prose: A large dataset of dense image cap- tions","venue":null,"work_id":"aeacb482-3a4d-4073-865a-d41ff1e7d1d3","year":2024},"citing_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-11T10:09:21.542356Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2412.10302"},"observation_digest":"sha256:f24f2ea1566ec4bda885d024ae6258d6c2ebcdc17f8f8f7125da5891a8b748b6","observation_id":"fdf7a16c-0e59-4fc1-91d5-130f6ccbcf13","resolution":{"observed_at":"2026-05-11T10:09:25.282416Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":"2406.10328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-06-29T13:23:28.438005Z","title":"From pixels to prose: A large dataset of dense image cap- tions","venue":null,"work_id":"aeacb482-3a4d-4073-865a-d41ff1e7d1d3","year":2024},"citing_paper":{"arxiv_id":"2504.09925","last_updated":"2026-04-29T06:12:36Z","snapshot_observed_at":"2026-08-02T07:57:37.201421Z","submitted_at":"2025-04-14T06:33:29Z","title":"FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-22T19:49:00.961388Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2504.09925"},"observation_digest":"sha256:f50c2bddb9ce67c79544e0387b819caf58093604229c9570d6236d4ac57f25b6","observation_id":"3e95b839-3773-4b95-99c6-bf0a01e15116","resolution":{"observed_at":"2026-05-22T19:52:01.832523Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-08-07T13:09:56.862819Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-07T13:00:31.038724Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:56.862819Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:ddb6ca40f566e7780b063ce19e77a03010d8c0163c981695edddae1e16ab6abb","observation_id":"8f4a2872-484e-4da9-85af-e0d56c56e405","resolution":{"observed_at":"2026-08-07T13:09:56.862819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-08-07T12:58:48.258130Z","title":"In Proceedings of the Seventh Conference on Machine Translation (WMT) , pages 578–585, Abu Dhabi, United Arab Emirates (Hybrid)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23078","last_updated":"2025-05-29T04:34:04Z","snapshot_observed_at":"2026-08-07T12:51:29.093571Z","submitted_at":"2025-05-29T04:34:04Z","title":"Document-Level Text Generation with Minimum Bayes Risk Decoding using Optimal Transport","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:48.258130Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2505.23078"},"observation_digest":"sha256:dfc7b220364005ef63445ea343f436e54c52f027b700747f777504a977446ff4","observation_id":"2cc224ce-97fb-4208-a204-b9c5ec103c97","resolution":{"observed_at":"2026-08-07T12:58:48.258130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-08-06T21:52:24.893267Z","title":"From pixels to prose: A large dataset of dense image captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.893267Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:ae2fe6b2ce316ceef36d0c1097db6ee5ea6eccaf34933819b2b0764bc69f96fc","observation_id":"4aaaa547-1faf-4365-b5ba-e27ee147e874","resolution":{"observed_at":"2026-08-06T21:52:24.893267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-08-06T19:06:03.980611Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06654","last_updated":"2025-07-09T08:38:46Z","snapshot_observed_at":"2026-08-06T18:55:30.402813Z","submitted_at":"2025-07-09T08:38:46Z","title":"MS-DPPs: Multi-Source Determinantal Point Processes for Contextual Diversity Refinement of Composite Attributes in Text to Image Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:03.980611Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2507.06654"},"observation_digest":"sha256:fd6d481060d8995731f77f5b251b6b52e8cc5e38b4afec823eca11360b1502bd","observation_id":"becd85ce-93b1-4790-9592-8da2c45b33fb","resolution":{"observed_at":"2026-08-06T19:06:03.980611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-08-06T05:59:15.603444Z","title":"From pixels to prose: A large dataset of dense image cap- tions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-07T09:44:40.622513Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.603444Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:7dcf34c823412295fefc3aaadeb4c24f56156d724f19ced004c0da0bb7c0e9c1","observation_id":"ce87387f-6774-4174-adf5-76bfa3e64914","resolution":{"observed_at":"2026-08-06T05:59:15.603444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-08-05T10:19:54.462627Z","title":"From pixels to prose: A large dataset of dense image cap- tions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04394","last_updated":"2025-09-04T17:05:59Z","snapshot_observed_at":"2026-08-06T05:46:13.034506Z","submitted_at":"2025-09-04T17:05:59Z","title":"Transition Models: Rethinking the Generative Learning Objective","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T10:19:54.462627Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2509.04394"},"observation_digest":"sha256:955a3827ea191f4b1cc637f96fc2f7f0236c6110400c463ecb1dfc6da9d9c8a5","observation_id":"93220cf9-883b-4f79-8d90-b1cfa87f3d93","resolution":{"observed_at":"2026-08-05T10:19:54.462627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-08-04T18:48:03.803853Z","title":"From pixels to prose: A large dataset of dense image captions.arXiv preprint arXiv:2406.10328, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.803853Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:4aa5b0635eca543f5b09970f65eee32928e64dcf6d4f054b278fe09efbfcd830","observation_id":"a40919a6-6724-4fa7-b093-3f5f9d14a557","resolution":{"observed_at":"2026-08-04T18:48:03.803853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":"2406.10328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-06-29T13:23:28.438005Z","title":"From pixels to prose: A large dataset of dense image cap- tions","venue":null,"work_id":"aeacb482-3a4d-4073-865a-d41ff1e7d1d3","year":2024},"citing_paper":{"arxiv_id":"2605.18115","last_updated":"2026-05-18T09:24:39Z","snapshot_observed_at":"2026-08-06T04:43:08.432770Z","submitted_at":"2026-05-18T09:24:39Z","title":"WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-20T12:04:19.761430Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2605.18115"},"observation_digest":"sha256:391028db37eae1ffa320dac1266f63cf7593a1365968ca9ae5d549fb042d0a7d","observation_id":"1e3a1767-f545-4f45-b653-e5e7622b1d96","resolution":{"observed_at":"2026-05-20T12:08:15.863682Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":"2406.10328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-06-29T13:23:28.438005Z","title":"From pixels to prose: A large dataset of dense image cap- tions","venue":null,"work_id":"aeacb482-3a4d-4073-865a-d41ff1e7d1d3","year":2024},"citing_paper":{"arxiv_id":"2605.21728","last_updated":"2026-05-20T20:43:38Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T20:43:38Z","title":"BEiTScore: Reference-free Image Captioning Evaluation with an Efficient Cross-Encoder Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T09:01:24.453821Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2605.21728"},"observation_digest":"sha256:d05f3dc202bf15f971a878458d9d4c9c1ccac38a9ae730f1d1850b162c932276","observation_id":"6fb820e6-d82a-455e-ac0b-fcf50011016b","resolution":{"observed_at":"2026-05-22T09:04:45.988241Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":"2406.10328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-06-29T13:23:28.438005Z","title":"From pixels to prose: A large dataset of dense image cap- tions","venue":null,"work_id":"aeacb482-3a4d-4073-865a-d41ff1e7d1d3","year":2024},"citing_paper":{"arxiv_id":"2605.28023","last_updated":"2026-05-27T06:27:04Z","snapshot_observed_at":"2026-08-02T21:20:31.316522Z","submitted_at":"2026-05-27T06:27:04Z","title":"VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T13:13:57.599970Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2605.28023"},"observation_digest":"sha256:e184ef4ebdb15cc29d6097a88a430599d521b071a2f4c8e93613daa43bd3b327","observation_id":"9416758b-e8e1-4ecd-9f1b-7af77abf22f4","resolution":{"observed_at":"2026-06-29T13:23:28.439444Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-08-02T06:14:02.725335Z","title":"From pixels to prose: A large dataset of dense image captions, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-08-02T06:14:02.725335Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:567646a5bc2d229ab94e5f6f8c641ca3f461b623c82c8519fde979f99bc6b9ad","observation_id":"f2f6443d-f7f4-4dff-bcb1-acd6bcf3d080","resolution":{"observed_at":"2026-08-02T06:14:02.725335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-08-05T00:49:46.472687Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00868","last_updated":"2026-08-04T07:47:28Z","snapshot_observed_at":"2026-08-07T19:10:00.688673Z","submitted_at":"2026-08-01T21:06:17Z","title":"MIDAL: A Dataset of Math Image Descriptions for Accessible Learning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T00:49:46.472687Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2608.00868"},"observation_digest":"sha256:fbf47597fa243e9ec6935fa229462ea91b249bba4154459d0b66d924e324fc0e","observation_id":"99b7a9c9-e0ce-4fd2-9a40-4f126a3beb0d","resolution":{"observed_at":"2026-08-05T00:49:46.472687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.10328/citation-record","integrity":"/paper/2406.10328/integrity","json":"/paper/2406.10328/citation-record.json","paper":"/paper/2406.10328"},"outbound":[],"paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2406.10328."}