{"as_of":"2026-08-06T03:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bfb686f22b28d0b0e90f73d8ded1d90e4fe52efd65fdae891a4840d6c3199505","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:58:36.852405Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T03:17:51.543739Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.07089","last_updated":"2025-06-02T09:38:26Z","snapshot_observed_at":"2026-07-06T21:06:50.056353Z","submitted_at":"2025-04-09T17:58:58Z","title":"OmniCaptioner: One Captioner to Rule Them All","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07089","snapshot_observed_at":"2026-08-05T22:58:36.852405Z","title":"Omnicaptioner: One captioner to rule them all","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-05T22:58:30.906381Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:36.852405Z"},"links":{"cited_paper":"/paper/2504.07089","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:a0c88cf4ae8f5c4e549eab04e279d45b8c731d23704aacbaf212d1272ef449db","observation_id":"e91735c6-df67-4819-b970-c7a0857b77f5","resolution":{"observed_at":"2026-08-05T22:58:36.852405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07089","last_updated":"2025-06-02T09:38:26Z","snapshot_observed_at":"2026-07-06T21:06:50.056353Z","submitted_at":"2025-04-09T17:58:58Z","title":"OmniCaptioner: One Captioner to Rule Them All","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07089","snapshot_observed_at":"2026-08-03T21:09:23.473947Z","title":"Omnicaptioner: One captioner to rule them all.ArXiv, abs/2504.07089, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16672","last_updated":"2026-06-09T22:19:41Z","snapshot_observed_at":"2026-08-03T21:09:20.139311Z","submitted_at":"2025-11-20T18:59:54Z","title":"EvoLMM: Self-Evolving Large Multimodal Models with Continuous Rewards","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T21:09:23.473947Z"},"links":{"cited_paper":"/paper/2504.07089","citing_paper":"/paper/2511.16672"},"observation_digest":"sha256:c5f2c259a049ab20eeed51dbd6741681cd8cd6e79fecec358a3298b51b762797","observation_id":"a7ed7b5c-c64b-4b29-89e0-41dc41e350d9","resolution":{"observed_at":"2026-08-03T21:09:23.473947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07089","last_updated":"2025-06-02T09:38:26Z","snapshot_observed_at":"2026-07-06T21:06:50.056353Z","submitted_at":"2025-04-09T17:58:58Z","title":"OmniCaptioner: One Captioner to Rule Them All","version":3},"cited_work":{"arxiv_id":"2504.07089","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07089","snapshot_observed_at":"2026-07-11T03:17:51.543739Z","title":"Omnicaptioner: One captioner to rule them all","venue":"cs.CV","work_id":"97453bde-de3a-45c0-8f6b-5c08fe830211","year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-11T14:08:36.801359Z"},"links":{"cited_paper":"/paper/2504.07089","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:4e398a627f69d701a3a8040e914013fd228e6263f790777294072282d29d98cc","observation_id":"c51d8ef9-8ad0-4d17-9ee5-a3d61fc27f41","resolution":{"observed_at":"2026-05-11T14:08:37.265735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07089","last_updated":"2025-06-02T09:38:26Z","snapshot_observed_at":"2026-07-06T21:06:50.056353Z","submitted_at":"2025-04-09T17:58:58Z","title":"OmniCaptioner: One Captioner to Rule Them All","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07089","snapshot_observed_at":"2026-08-03T19:47:32.786122Z","title":"Omnicaptioner: One captioner to rule them all.arXiv preprint arXiv:2504.07089, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.786122Z"},"links":{"cited_paper":"/paper/2504.07089","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:645fe40dd65743c00804143727275b84f124fb1f590bf1b8e5b7332d3752861a","observation_id":"c21bfeb1-2a69-48f2-8e4d-de3b6d031cfa","resolution":{"observed_at":"2026-08-03T19:47:32.786122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07089","last_updated":"2025-06-02T09:38:26Z","snapshot_observed_at":"2026-07-06T21:06:50.056353Z","submitted_at":"2025-04-09T17:58:58Z","title":"OmniCaptioner: One Captioner to Rule Them All","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07089","snapshot_observed_at":"2026-07-14T23:22:13.847876Z","title":"Omnicaptioner: One captioner to rule them all","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.10757","last_updated":"2026-06-20T10:12:15Z","snapshot_observed_at":"2026-08-05T13:26:31.195049Z","submitted_at":"2026-03-11T13:32:58Z","title":"CodePercept: Code-Grounded Visual STEM Perception for MLLMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T23:22:13.847876Z"},"links":{"cited_paper":"/paper/2504.07089","citing_paper":"/paper/2603.10757"},"observation_digest":"sha256:15da5db1f5705c8bde346b77874b061c875d6cc01274470e688b0af9036dda72","observation_id":"661e7ce4-ad9a-45d9-bd79-4b1ae5053281","resolution":{"observed_at":"2026-07-14T23:22:13.847876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07089","last_updated":"2025-06-02T09:38:26Z","snapshot_observed_at":"2026-07-06T21:06:50.056353Z","submitted_at":"2025-04-09T17:58:58Z","title":"OmniCaptioner: One Captioner to Rule Them All","version":3},"cited_work":{"arxiv_id":"2504.07089","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07089","snapshot_observed_at":"2026-07-11T03:17:51.543739Z","title":"Omnicaptioner: One captioner to rule them all","venue":"cs.CV","work_id":"97453bde-de3a-45c0-8f6b-5c08fe830211","year":2025},"citing_paper":{"arxiv_id":"2604.05623","last_updated":"2026-04-07T09:27:01Z","snapshot_observed_at":"2026-07-06T22:54:16.913706Z","submitted_at":"2026-04-07T09:27:01Z","title":"DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T18:39:29.592129Z"},"links":{"cited_paper":"/paper/2504.07089","citing_paper":"/paper/2604.05623"},"observation_digest":"sha256:6cb89cf50666333dc2f1b718205bb11d4d26265d632c83b172e18017fa134454","observation_id":"30f33aa0-b206-4d6c-93c1-2d1309a7affe","resolution":{"observed_at":"2026-05-11T00:10:52.847901Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07089","last_updated":"2025-06-02T09:38:26Z","snapshot_observed_at":"2026-07-06T21:06:50.056353Z","submitted_at":"2025-04-09T17:58:58Z","title":"OmniCaptioner: One Captioner to Rule Them All","version":3},"cited_work":{"arxiv_id":"2504.07089","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07089","snapshot_observed_at":"2026-07-11T03:17:51.543739Z","title":"Omnicaptioner: One captioner to rule them all","venue":"cs.CV","work_id":"97453bde-de3a-45c0-8f6b-5c08fe830211","year":2025},"citing_paper":{"arxiv_id":"2605.04503","last_updated":"2026-05-06T05:12:41Z","snapshot_observed_at":"2026-08-02T14:20:11.154625Z","submitted_at":"2026-05-06T05:12:41Z","title":"DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T17:56:47.621050Z"},"links":{"cited_paper":"/paper/2504.07089","citing_paper":"/paper/2605.04503"},"observation_digest":"sha256:ddcae9c438385632c77dcbdd35322d0973de4eba994be4fac9016053cd81b577","observation_id":"7fbaec1f-7bdb-4f93-a552-67b33733d204","resolution":{"observed_at":"2026-05-09T06:55:44.238614Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07089","last_updated":"2025-06-02T09:38:26Z","snapshot_observed_at":"2026-07-06T21:06:50.056353Z","submitted_at":"2025-04-09T17:58:58Z","title":"OmniCaptioner: One Captioner to Rule Them All","version":3},"cited_work":{"arxiv_id":"2504.07089","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07089","snapshot_observed_at":"2026-07-11T03:17:51.543739Z","title":"Omnicaptioner: One captioner to rule them all","venue":"cs.CV","work_id":"97453bde-de3a-45c0-8f6b-5c08fe830211","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2504.07089","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:37460940dec6c446a6eafb85ec6120d64251d747a9b290f329d8e0b0ecebd5c5","observation_id":"f4e8a51d-2404-4008-af5e-42bb65278d08","resolution":{"observed_at":"2026-07-02T17:27:15.021888Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07089","last_updated":"2025-06-02T09:38:26Z","snapshot_observed_at":"2026-07-06T21:06:50.056353Z","submitted_at":"2025-04-09T17:58:58Z","title":"OmniCaptioner: One Captioner to Rule Them All","version":3},"cited_work":{"arxiv_id":"2504.07089","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07089","snapshot_observed_at":"2026-07-11T03:17:51.543739Z","title":"Omnicaptioner: One captioner to rule them all","venue":"cs.CV","work_id":"97453bde-de3a-45c0-8f6b-5c08fe830211","year":2025},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T03:11:49.713677Z"},"links":{"cited_paper":"/paper/2504.07089","citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:3b2f1b879cbfac15dd63da9d7813dee1b5de7b5aa90c9de4f6bed03116be64d9","observation_id":"2f302196-1973-4509-88fc-adeaf37cf13d","resolution":{"observed_at":"2026-07-11T03:17:51.572452Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07089","last_updated":"2025-06-02T09:38:26Z","snapshot_observed_at":"2026-07-06T21:06:50.056353Z","submitted_at":"2025-04-09T17:58:58Z","title":"OmniCaptioner: One Captioner to Rule Them All","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07089","snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"Omnicaptioner: One cap- tioner to rule them all.arXiv preprint arXiv:2504.07089,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"cited_paper":"/paper/2504.07089","citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:2c9303dfc5475d8a57de37a633ab03a1ca43ff947ca6fcc9ca0b4136558fc2a2","observation_id":"28cde4be-7dcf-4d3d-893c-76029b9f4b60","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.07089/citation-record","integrity":"/paper/2504.07089/integrity","json":"/paper/2504.07089/citation-record.json","paper":"/paper/2504.07089"},"outbound":[],"paper":{"arxiv_id":"2504.07089","last_updated":"2025-06-02T09:38:26Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T21:06:50.056353Z","submitted_at":"2025-04-09T17:58:58Z","title":"OmniCaptioner: One Captioner to Rule Them All"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2504.07089."}