{"as_of":"2026-08-06T21:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:69a425a8181d8be8f8cb4677e1c08f49b05186a7f2caeb9c4b4564008785ef3c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:23:45.751588Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:27:36.866746Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.06720","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-07-03T04:27:36.866746Z","title":"Audio-visual llm for video understanding","venue":null,"work_id":"f81c01aa-202a-4445-b365-2cc2b4e44a43","year":2023},"citing_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-11T02:44:53.284345Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2406.07476"},"observation_digest":"sha256:ff4847df20fd5dae46240cd6020cd1ea732c9d4e268870a8d174b97d040fe93a","observation_id":"9c3355a9-bca8-4cc7-8895-0fa71688eca1","resolution":{"observed_at":"2026-05-11T02:44:53.634793Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.06720","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-07-03T04:27:36.866746Z","title":"Audio-visual llm for video understanding","venue":null,"work_id":"f81c01aa-202a-4445-b365-2cc2b4e44a43","year":2023},"citing_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T21:08:19.570050Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2501.01957"},"observation_digest":"sha256:27d8ca3aa0eac80f1a1d10b8da666cd3d08d6c48ae12fff23b061f806f8c02df","observation_id":"f56fd9f8-008a-434e-98bf-c4f74ea804ec","resolution":{"observed_at":"2026-05-17T21:08:19.785427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.06720","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-07-03T04:27:36.866746Z","title":"Audio-visual llm for video understanding","venue":null,"work_id":"f81c01aa-202a-4445-b365-2cc2b4e44a43","year":2023},"citing_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"reference_index":157,"source":"pdf_text","source_observed_at":"2026-05-11T01:19:59.603343Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2501.13106"},"observation_digest":"sha256:0a69eb9044fd56e1a28509faaf829c2702a7f0d9af1611bb863a14f4ebbc7f45","observation_id":"d6b5824c-d880-4145-867f-cfec6ee61f70","resolution":{"observed_at":"2026-05-11T01:20:00.157256Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.06720","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-07-03T04:27:36.866746Z","title":"Audio-visual llm for video understanding","venue":null,"work_id":"f81c01aa-202a-4445-b365-2cc2b4e44a43","year":2023},"citing_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T09:43:00.208065Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2503.21776"},"observation_digest":"sha256:0f08141410eed54fdc321bd903f652af5ad6c18df44a773dad70c603720d91b1","observation_id":"bf0cfcfd-0c56-4fce-a101-93c74b334982","resolution":{"observed_at":"2026-05-12T09:43:00.428279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-08-06T21:23:45.751588Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00286","last_updated":"2025-07-19T04:31:05Z","snapshot_observed_at":"2026-08-06T21:17:40.683342Z","submitted_at":"2025-06-30T21:55:21Z","title":"\"Before, I Asked My Mom, Now I Ask ChatGPT\": Visual Privacy Management with Generative AI for Blind and Low-Vision People","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:45.751588Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2507.00286"},"observation_digest":"sha256:d3041d3f8517d76a43930581da7a04387512db2bab13a72ddb7fc04cfd7493a0","observation_id":"3c1bf8c1-3523-453a-9fb7-56d662b584e5","resolution":{"observed_at":"2026-08-06T21:23:45.751588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-08-06T14:36:29.216841Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.216841Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:49996e42f3aa51a9fe9a13efb298ae3576984b87eff283aba41feac3fa09ff70","observation_id":"bc1ed0eb-b562-42ae-a323-31a5a96752f1","resolution":{"observed_at":"2026-08-06T14:36:29.216841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-08-06T13:12:40.249511Z","title":"Audio-visual llm for video understanding.arXiv preprint arXiv:2312.06720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-06T13:12:37.106962Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:12:40.249511Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2507.20939"},"observation_digest":"sha256:fa29815f9e3753fc27f64b957446aa62815fe0619a031bf88308f258742265d6","observation_id":"b4a0a645-4785-4ba4-a8bd-573947db35c1","resolution":{"observed_at":"2026-08-06T13:12:40.249511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.06720","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-07-03T04:27:36.866746Z","title":"Audio-visual llm for video understanding","venue":null,"work_id":"f81c01aa-202a-4445-b365-2cc2b4e44a43","year":2023},"citing_paper":{"arxiv_id":"2510.18346","last_updated":"2026-07-10T08:37:10Z","snapshot_observed_at":"2026-08-04T08:55:20.368663Z","submitted_at":"2025-10-21T06:58:34Z","title":"AV-Master: Dual-Path Comprehensive Perception Makes Better Audio-Visual Question Answering","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-18T05:26:07.722390Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2510.18346"},"observation_digest":"sha256:3c2ce76783c931a24d0e5b6bb5f3a79c6dc85cb007c20328e55cc85302069b5a","observation_id":"0a5b208f-05a0-45e2-9930-fc1c196af9fd","resolution":{"observed_at":"2026-05-18T05:30:55.403906Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-08-04T08:55:26.153084Z","title":"Audio-visual llm for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18346","last_updated":"2026-07-10T08:37:10Z","snapshot_observed_at":"2026-08-04T08:55:20.368663Z","submitted_at":"2025-10-21T06:58:34Z","title":"AV-Master: Dual-Path Comprehensive Perception Makes Better Audio-Visual Question Answering","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T08:55:26.153084Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2510.18346"},"observation_digest":"sha256:a48e405f50a591ee46f25fc58537ecb0430655ca2f3452e72916092d61c2f459","observation_id":"52e6c9c0-0ce5-47fc-96f6-0e6a2b0a3fb1","resolution":{"observed_at":"2026-08-04T08:55:26.153084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.06720","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-07-03T04:27:36.866746Z","title":"Audio-visual llm for video understanding","venue":null,"work_id":"f81c01aa-202a-4445-b365-2cc2b4e44a43","year":2023},"citing_paper":{"arxiv_id":"2606.10533","last_updated":"2026-06-09T08:04:06Z","snapshot_observed_at":"2026-08-05T15:31:34.855440Z","submitted_at":"2026-06-09T08:04:06Z","title":"Audio-Visual Exchange-Aware Token Pruning for Efficient Audio-Visual Captioning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T13:53:53.520545Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2606.10533"},"observation_digest":"sha256:eedb21ca07ed39a6c627d31acdd68984eb97ad74d334de1356eddb9748868aff","observation_id":"e99330e2-0e58-43c7-a6f6-f913315cf8e1","resolution":{"observed_at":"2026-07-03T04:27:36.868245Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2312.06720/citation-record","integrity":"/paper/2312.06720/integrity","json":"/paper/2312.06720/citation-record.json","paper":"/paper/2312.06720"},"outbound":[],"paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2312.06720."}