{"as_of":"2026-08-09T12:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2dd29efcb0f3de1db25c9b5ea1fec5b264896c0013dae3f01a6bc5b6935ed50c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:41:44.453339Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T00:17:29.025254Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.08303","last_updated":"2024-11-24T13:14:47Z","snapshot_observed_at":"2026-07-06T18:44:41.370135Z","submitted_at":"2024-07-11T08:48:06Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","version":2},"cited_work":{"arxiv_id":"2407.08303","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08303","snapshot_observed_at":"2026-07-03T00:17:29.025254Z","title":"Densefusion-1m: Merging vision experts for comprehensive multimodal perception","venue":null,"work_id":"27b98cfa-a31f-4a87-ad74-00d4b025c8b0","year":2024},"citing_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-11T10:56:06.418360Z"},"links":{"cited_paper":"/paper/2407.08303","citing_paper":"/paper/2409.18869"},"observation_digest":"sha256:f088d3964d1e0681ed3572674ca43c37b2846769db083df027fe741f0cb1ab7a","observation_id":"6f81342e-bd97-4abe-baba-5a01192baf65","resolution":{"observed_at":"2026-05-11T10:56:08.956957Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08303","last_updated":"2024-11-24T13:14:47Z","snapshot_observed_at":"2026-07-06T18:44:41.370135Z","submitted_at":"2024-07-11T08:48:06Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","version":2},"cited_work":{"arxiv_id":"2407.08303","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08303","snapshot_observed_at":"2026-07-03T00:17:29.025254Z","title":"Densefusion-1m: Merging vision experts for comprehensive multimodal perception","venue":null,"work_id":"27b98cfa-a31f-4a87-ad74-00d4b025c8b0","year":2024},"citing_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T22:09:16.001309Z"},"links":{"cited_paper":"/paper/2407.08303","citing_paper":"/paper/2410.13848"},"observation_digest":"sha256:61c4692c41c2eaebe675317d0da4908e2c9881a347d8c218cb16c681a7170686","observation_id":"a8f2966c-ba4d-41d2-9f6c-40cda4fe35e9","resolution":{"observed_at":"2026-05-15T22:09:16.163144Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08303","last_updated":"2024-11-24T13:14:47Z","snapshot_observed_at":"2026-07-06T18:44:41.370135Z","submitted_at":"2024-07-11T08:48:06Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","version":2},"cited_work":{"arxiv_id":"2407.08303","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08303","snapshot_observed_at":"2026-07-03T00:17:29.025254Z","title":"Densefusion-1m: Merging vision experts for comprehensive multimodal perception","venue":null,"work_id":"27b98cfa-a31f-4a87-ad74-00d4b025c8b0","year":2024},"citing_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-11T10:09:21.542356Z"},"links":{"cited_paper":"/paper/2407.08303","citing_paper":"/paper/2412.10302"},"observation_digest":"sha256:3950ce1b6dd2b4fb747b0d9076d336384fa091939a080483f021f366a818fa9f","observation_id":"b65a97ec-b51e-406b-b27d-24f6728f9732","resolution":{"observed_at":"2026-05-11T10:09:24.036364Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08303","last_updated":"2024-11-24T13:14:47Z","snapshot_observed_at":"2026-07-06T18:44:41.370135Z","submitted_at":"2024-07-11T08:48:06Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","version":2},"cited_work":{"arxiv_id":"2407.08303","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08303","snapshot_observed_at":"2026-07-03T00:17:29.025254Z","title":"Densefusion-1m: Merging vision experts for comprehensive multimodal perception","venue":null,"work_id":"27b98cfa-a31f-4a87-ad74-00d4b025c8b0","year":2024},"citing_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-11T01:19:59.603343Z"},"links":{"cited_paper":"/paper/2407.08303","citing_paper":"/paper/2501.13106"},"observation_digest":"sha256:a94fc9f62bdcbcf075d2e7c7d428df5ae7c258a9fe295c72174b2090cd8ade56","observation_id":"1c76186e-249a-4591-8610-c7f7bf3feff7","resolution":{"observed_at":"2026-05-11T01:19:59.819018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08303","last_updated":"2024-11-24T13:14:47Z","snapshot_observed_at":"2026-07-06T18:44:41.370135Z","submitted_at":"2024-07-11T08:48:06Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08303","snapshot_observed_at":"2026-08-09T11:41:44.453339Z","title":"Densefusion-1m: Merg- ing vision experts for comprehensive multimodal perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02589","last_updated":"2025-02-04T18:59:46Z","snapshot_observed_at":"2026-08-09T11:35:42.990078Z","submitted_at":"2025-02-04T18:59:46Z","title":"COCONut-PanCap: Joint Panoptic Segmentation and Grounded Captions for Fine-Grained Understanding and Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T11:41:44.453339Z"},"links":{"cited_paper":"/paper/2407.08303","citing_paper":"/paper/2502.02589"},"observation_digest":"sha256:b8a7e07554d6b8ee3753cde96da5c6af951a2ea8d97d2aeecd4def2583f46d49","observation_id":"43b09f0f-cfdd-4c8f-9c43-1143b7357f62","resolution":{"observed_at":"2026-08-09T11:41:44.453339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08303","last_updated":"2024-11-24T13:14:47Z","snapshot_observed_at":"2026-07-06T18:44:41.370135Z","submitted_at":"2024-07-11T08:48:06Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08303","snapshot_observed_at":"2026-08-08T14:25:55.743104Z","title":"Densefusion-1m: Merging vision experts for comprehensive multimodal perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.743104Z"},"links":{"cited_paper":"/paper/2407.08303","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:5b5e5c71ff29d687dc3c047700e93963bdb03b61d1183d41657c5085242481db","observation_id":"e5b52559-e7e7-42ee-8c3b-0be5be797755","resolution":{"observed_at":"2026-08-08T14:25:55.743104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08303","last_updated":"2024-11-24T13:14:47Z","snapshot_observed_at":"2026-07-06T18:44:41.370135Z","submitted_at":"2024-07-11T08:48:06Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","version":2},"cited_work":{"arxiv_id":"2407.08303","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08303","snapshot_observed_at":"2026-07-03T00:17:29.025254Z","title":"Densefusion-1m: Merging vision experts for comprehensive multimodal perception","venue":null,"work_id":"27b98cfa-a31f-4a87-ad74-00d4b025c8b0","year":2024},"citing_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-12T18:51:15.428692Z"},"links":{"cited_paper":"/paper/2407.08303","citing_paper":"/paper/2506.15564"},"observation_digest":"sha256:b4acda7453bd82dba6d82d5ee10f32d9287a23e0dd68cd05df4d51cb7abe90fd","observation_id":"f93e43ac-949c-4386-9124-a7ab07fdf843","resolution":{"observed_at":"2026-05-12T18:51:15.991623Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08303","last_updated":"2024-11-24T13:14:47Z","snapshot_observed_at":"2026-07-06T18:44:41.370135Z","submitted_at":"2024-07-11T08:48:06Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08303","snapshot_observed_at":"2026-08-06T23:57:24.067810Z","title":"arXiv preprint arXiv:2407.08303 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15681","last_updated":"2026-06-25T14:33:27Z","snapshot_observed_at":"2026-08-08T08:54:57.204006Z","submitted_at":"2025-06-18T17:59:49Z","title":"GenRecal: Generation after Recalibration from Large to Small Vision-Language Models","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:24.067810Z"},"links":{"cited_paper":"/paper/2407.08303","citing_paper":"/paper/2506.15681"},"observation_digest":"sha256:d50d0c80cbb57b511bc57387d6b59fe2f071709860e32b277fbf64f9b71f3a55","observation_id":"e3aa9530-bfdd-4844-9640-dd64e7f01dc9","resolution":{"observed_at":"2026-08-06T23:57:24.067810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08303","last_updated":"2024-11-24T13:14:47Z","snapshot_observed_at":"2026-07-06T18:44:41.370135Z","submitted_at":"2024-07-11T08:48:06Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","version":2},"cited_work":{"arxiv_id":"2407.08303","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08303","snapshot_observed_at":"2026-07-03T00:17:29.025254Z","title":"Densefusion-1m: Merging vision experts for comprehensive multimodal perception","venue":null,"work_id":"27b98cfa-a31f-4a87-ad74-00d4b025c8b0","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2407.08303","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:12b3371c0e3dbdfed9c428b3763c2cedc4b2e3c5b6f8a7d84f8d53aa60a7d82a","observation_id":"ea64e559-00bb-49fa-9315-8e5b1445afbb","resolution":{"observed_at":"2026-05-19T07:52:10.872328Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08303","last_updated":"2024-11-24T13:14:47Z","snapshot_observed_at":"2026-07-06T18:44:41.370135Z","submitted_at":"2024-07-11T08:48:06Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08303","snapshot_observed_at":"2026-08-06T18:20:53.520305Z","title":"Densefusion-1m: Merging vision experts for comprehensive multimodal perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08505","last_updated":"2025-07-14T08:25:14Z","snapshot_observed_at":"2026-08-07T08:50:41.054794Z","submitted_at":"2025-07-11T11:30:57Z","title":"Efficient Deployment of Vision-Language Models on Mobile Devices: A Case Study on OnePlus 13R","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:53.520305Z"},"links":{"cited_paper":"/paper/2407.08303","citing_paper":"/paper/2507.08505"},"observation_digest":"sha256:9c040be4bc3e9ce224f49d8bfbbeb3753dbc883007c9b4c0e34d64bc154a66ab","observation_id":"75fc37fc-9c21-4d22-829f-a0592d761a66","resolution":{"observed_at":"2026-08-06T18:20:53.520305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08303","last_updated":"2024-11-24T13:14:47Z","snapshot_observed_at":"2026-07-06T18:44:41.370135Z","submitted_at":"2024-07-11T08:48:06Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","version":2},"cited_work":{"arxiv_id":"2407.08303","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08303","snapshot_observed_at":"2026-07-03T00:17:29.025254Z","title":"Densefusion-1m: Merging vision experts for comprehensive multimodal perception","venue":null,"work_id":"27b98cfa-a31f-4a87-ad74-00d4b025c8b0","year":2024},"citing_paper":{"arxiv_id":"2606.09393","last_updated":"2026-06-08T12:09:20Z","snapshot_observed_at":"2026-08-07T21:51:25.793927Z","submitted_at":"2026-06-08T12:09:20Z","title":"CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T17:21:38.543724Z"},"links":{"cited_paper":"/paper/2407.08303","citing_paper":"/paper/2606.09393"},"observation_digest":"sha256:ec486b5750d74e352c7efd2efc35938c032ff9825a182fac6f4812ab8206346b","observation_id":"736aeb7c-7f49-471f-88a5-e1ac314cf19b","resolution":{"observed_at":"2026-07-03T00:17:29.026830Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2407.08303/citation-record","integrity":"/paper/2407.08303/integrity","json":"/paper/2407.08303/citation-record.json","paper":"/paper/2407.08303"},"outbound":[],"paper":{"arxiv_id":"2407.08303","last_updated":"2024-11-24T13:14:47Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T18:44:41.370135Z","submitted_at":"2024-07-11T08:48:06Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2407.08303."}