{"as_of":"2026-08-08T13:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6203c467fdd12378abd196422f6650f36c4a414af0389450416766e9134d4721","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:14:37.686789Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:54.928668Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":"2410.03051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-07-04T15:09:54.928668Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":"3c75ba15-49f8-4ea3-87a8-6c357f825176","year":2024},"citing_paper":{"arxiv_id":"2412.17574","last_updated":"2026-04-13T15:05:36Z","snapshot_observed_at":"2026-07-06T20:12:09.120832Z","submitted_at":"2024-12-23T13:45:56Z","title":"HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarks","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-23T07:05:08.716223Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2412.17574"},"observation_digest":"sha256:3967b9d00f260e21b6bf317653ed1b8a85884aef078989cbc6c36871535bbc7a","observation_id":"831294d4-84b3-4832-bc3a-b50709e32390","resolution":{"observed_at":"2026-05-23T07:05:29.239902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":"2410.03051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-07-04T15:09:54.928668Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":"3c75ba15-49f8-4ea3-87a8-6c357f825176","year":2024},"citing_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T00:32:41.059558Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2501.13826"},"observation_digest":"sha256:799b412dfa828d9c47451e9e68f8cd7de03d0dac1e19dbe1f18e2e8d40bbaee3","observation_id":"68652cac-f1a8-4700-8de1-5f779442999b","resolution":{"observed_at":"2026-05-14T00:32:41.152534Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":"2410.03051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-07-04T15:09:54.928668Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":"3c75ba15-49f8-4ea3-87a8-6c357f825176","year":2024},"citing_paper":{"arxiv_id":"2503.14075","last_updated":"2026-04-10T01:08:12Z","snapshot_observed_at":"2026-07-06T20:54:36.522651Z","submitted_at":"2025-03-18T09:52:45Z","title":"Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T23:58:57.819555Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2503.14075"},"observation_digest":"sha256:ea6533101f49653aa560ed5f0d5bf6ddf4b9f842dc23b6d1ddc5dc868ad5d9ee","observation_id":"2537b212-0d3b-463a-bec1-b35f1d15dcc5","resolution":{"observed_at":"2026-05-23T00:02:17.878492Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-08-07T14:14:37.686789Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark.arXiv preprint arXiv:2410.03051, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:37.686789Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:c65103cec573fe019cc7327d535083a845d2f87fdfb5fd80a15ee96eaec719bd","observation_id":"caca77dd-0c7f-436f-a4a7-f8dbfe66e7db","resolution":{"observed_at":"2026-08-07T14:14:37.686789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-08-07T14:02:59.661583Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:02:59.661583Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:f021fcbbd7668ed721e0fa5b5cafa8034cb526dbd2a164704a19b40512150a96","observation_id":"286408a4-2bf5-439d-b8c2-c1f170a644df","resolution":{"observed_at":"2026-08-07T14:02:59.661583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-08-07T12:50:00.159271Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03179","last_updated":"2025-05-29T13:17:25Z","snapshot_observed_at":"2026-08-08T00:26:20.360231Z","submitted_at":"2025-05-29T13:17:25Z","title":"Vid-SME: Membership Inference Attacks against Large Video Understanding Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:00.159271Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2506.03179"},"observation_digest":"sha256:52bcdba901086138c93b2715b23ef54821ed893618d376495d80af1e7bbc3261","observation_id":"14d775da-00a6-4a49-9a83-208061a1d3d8","resolution":{"observed_at":"2026-08-07T12:50:00.159271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-08-07T05:41:39.591343Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07371","last_updated":"2025-06-10T13:33:53Z","snapshot_observed_at":"2026-08-07T10:51:02.440475Z","submitted_at":"2025-06-09T02:42:13Z","title":"ARGUS: Hallucination and Omission Evaluation in Video-LLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:39.591343Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2506.07371"},"observation_digest":"sha256:9d78abcacd3ff5ce30e63389297cd41fad42185940d799c73868eeaf49efef7a","observation_id":"ea527a28-a167-4066-bada-0ccd3e18f566","resolution":{"observed_at":"2026-08-07T05:41:39.591343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-08-06T23:01:29.947783Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20066","last_updated":"2025-06-24T23:58:20Z","snapshot_observed_at":"2026-08-08T00:48:32.373291Z","submitted_at":"2025-06-24T23:58:20Z","title":"ToSA: Token Merging with Spatial Awareness","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:29.947783Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2506.20066"},"observation_digest":"sha256:e96635bc2e9caaad844179d5eb468f566e98df0e7903117bb660935ef185be16","observation_id":"3bf9bb16-7765-40f5-b839-9587f6f7bfcb","resolution":{"observed_at":"2026-08-06T23:01:29.947783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-08-06T20:53:19.764060Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-06T20:47:37.885961Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:19.764060Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:3baa42ef7b8ed4b1732e4551de042f0796f49723cdde90c9c2c22dff739f8d86","observation_id":"2e94a8c9-1420-4ad4-97ce-400db8aba0f9","resolution":{"observed_at":"2026-08-06T20:53:19.764060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-08-06T20:29:48.227081Z","title":"Auroracap: Ef- ficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-07T06:17:01.457380Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:48.227081Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:43ddc95e9b626518ccafebe07e494fb2e86d047214477f093ed5994e3099d69c","observation_id":"7b21e852-8f3b-4f2d-9372-9a4dce0f8077","resolution":{"observed_at":"2026-08-06T20:29:48.227081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-08-06T00:03:26.518534Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04415","last_updated":"2025-08-06T13:03:16Z","snapshot_observed_at":"2026-08-07T20:42:58.746080Z","submitted_at":"2025-08-06T13:03:16Z","title":"Empowering Nanoscale Connectivity through Molecular Communication: A Case Study of Virus Infection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T00:03:26.518534Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2508.04415"},"observation_digest":"sha256:bb9674e052ff642a79116a27afadb76a6b847f29928fb797a529f93c5c7f8b45","observation_id":"50b612f2-6f4e-4f4d-b273-6ace6548816b","resolution":{"observed_at":"2026-08-06T00:03:26.518534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":"2410.03051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-07-04T15:09:54.928668Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":"3c75ba15-49f8-4ea3-87a8-6c357f825176","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-07T14:16:18.120869Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:dd7e7d4b386099ee8d89ae5cf3c8e5c7a7cb82dc8c1bed5b3ef78fcbdd058e0f","observation_id":"307b969c-1c54-4663-83d5-2209560690f9","resolution":{"observed_at":"2026-05-15T18:26:27.013397Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":"2410.03051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-07-04T15:09:54.928668Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":"3c75ba15-49f8-4ea3-87a8-6c357f825176","year":2024},"citing_paper":{"arxiv_id":"2603.22911","last_updated":"2026-04-12T14:01:49Z","snapshot_observed_at":"2026-08-03T01:43:21.251112Z","submitted_at":"2026-03-24T08:01:16Z","title":"ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models via Spatial-Temporal Forest Modeling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T00:56:47.841355Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2603.22911"},"observation_digest":"sha256:53b30241007e9a2cae9c50ea36fdcb64cb6e2900dfa2ff0577f535a0278745e2","observation_id":"cdf41a37-fada-4535-901d-9ea0ad180cda","resolution":{"observed_at":"2026-05-15T00:58:25.635849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":"2410.03051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-07-04T15:09:54.928668Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":"3c75ba15-49f8-4ea3-87a8-6c357f825176","year":2024},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:7d91771bedfb03401d601eaeb4199e9cb62f36ce4109a3bfd1cfb311aed767f1","observation_id":"9fdf966d-545e-41f9-a686-acde1a8d4700","resolution":{"observed_at":"2026-05-11T13:46:04.576239Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":"2410.03051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-07-04T15:09:54.928668Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":"3c75ba15-49f8-4ea3-87a8-6c357f825176","year":2024},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-08-02T13:39:32.739295Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:11c6f3385bb1c362170e8ac80ccefa71a7d36143e3a8fb31a79d363e47dc7dbb","observation_id":"1f19ee89-936f-4124-b487-3852d4baad26","resolution":{"observed_at":"2026-05-11T18:46:07.544729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":"2410.03051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-07-04T15:09:54.928668Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":"3c75ba15-49f8-4ea3-87a8-6c357f825176","year":2024},"citing_paper":{"arxiv_id":"2606.01900","last_updated":"2026-06-01T08:41:01Z","snapshot_observed_at":"2026-08-07T15:28:17.194018Z","submitted_at":"2026-06-01T08:41:01Z","title":"Auteur: Language-Driven Cinematographic Framing for Human-Centric Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T15:47:33.435653Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2606.01900"},"observation_digest":"sha256:b12fdf5f64ec41b3c62ac5c4ac4095dfed8e846ed125fbfdd6172c1dc1d7dc0f","observation_id":"5715f666-a5d1-451f-928e-f5e25c060ee4","resolution":{"observed_at":"2026-07-01T22:06:16.313840Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":"2410.03051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-07-04T15:09:54.928668Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":"3c75ba15-49f8-4ea3-87a8-6c357f825176","year":2024},"citing_paper":{"arxiv_id":"2606.05552","last_updated":"2026-06-04T01:06:52Z","snapshot_observed_at":"2026-07-06T23:45:33.157370Z","submitted_at":"2026-06-04T01:06:52Z","title":"Balancing Image Compression and Generation with Bootstrapped Tokenization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T03:07:33.054518Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2606.05552"},"observation_digest":"sha256:9824e4f328671c968057f58e0f49024002f2a1c0712f7cdda0c389facce08ca5","observation_id":"9c1e0d0d-2b0d-4e9c-a200-53bc6e838f59","resolution":{"observed_at":"2026-07-02T11:46:55.406296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":"2410.03051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-07-04T15:09:54.928668Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":"3c75ba15-49f8-4ea3-87a8-6c357f825176","year":2024},"citing_paper":{"arxiv_id":"2606.06532","last_updated":"2026-06-03T17:47:49Z","snapshot_observed_at":"2026-08-07T12:55:44.925060Z","submitted_at":"2026-06-03T17:47:49Z","title":"GOPAgen: Motion-Aware and Efficient Agentic Long-Video Understanding with Structural Memory and Hierarchical Reasoning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-28T06:33:32.090913Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2606.06532"},"observation_digest":"sha256:83728a4ac0724fb6c3980d78cdb1458f673a5e82e0afca839e983b4e807a9870","observation_id":"6098b20b-c083-409d-ae59-491209b36e95","resolution":{"observed_at":"2026-07-02T07:56:47.382456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":"2410.03051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-07-04T15:09:54.928668Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":"3c75ba15-49f8-4ea3-87a8-6c357f825176","year":2024},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:6d446438fe71d635a8a26fb42a86c5ea419faa18eea3d03261d261c31968878d","observation_id":"00fc8319-181c-4837-ad2f-97b1f9e2570d","resolution":{"observed_at":"2026-07-02T17:27:15.575211Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":"2410.03051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-07-04T15:09:54.928668Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":"3c75ba15-49f8-4ea3-87a8-6c357f825176","year":2024},"citing_paper":{"arxiv_id":"2606.21949","last_updated":"2026-06-20T08:37:32Z","snapshot_observed_at":"2026-08-06T09:36:36.931955Z","submitted_at":"2026-06-20T08:37:32Z","title":"CapRiCorn-1K: A Comprehensive Benchmark for Video Captioning and Subject Referential Consistency Across Temporal Scales","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T12:09:01.026544Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2606.21949"},"observation_digest":"sha256:9f30fde414c8c9471c62019d1b3e023289719137138f01ba799b04db71989563","observation_id":"7aff1fca-7e12-45ca-a8f0-9ba6eb33cb73","resolution":{"observed_at":"2026-07-04T08:09:41.272203Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":"2410.03051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-07-04T15:09:54.928668Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":"3c75ba15-49f8-4ea3-87a8-6c357f825176","year":2024},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:ea07c265f510198988d6e55f9bc67ed6938aafd273e3f82eb312958dbeeed0c9","observation_id":"48128038-df63-4ab8-b3bf-897687c62909","resolution":{"observed_at":"2026-07-04T15:09:54.930565Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-08-01T10:02:03.141536Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20389","last_updated":"2026-07-22T17:17:33Z","snapshot_observed_at":"2026-08-07T12:38:32.377959Z","submitted_at":"2026-07-22T17:17:33Z","title":"PercepCap: Video Captioner with Structured Spatio-Temporal Perception","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T10:02:03.141536Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2607.20389"},"observation_digest":"sha256:550ced918ac146b8b665ce6c29b2b828a48641880858d358f499c2274c729025","observation_id":"4a2ab20c-32cd-4207-afa5-4298ace80d12","resolution":{"observed_at":"2026-08-01T10:02:03.141536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-08-01T13:10:37.202730Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22716","last_updated":"2026-07-21T15:52:30Z","snapshot_observed_at":"2026-08-06T12:10:57.542923Z","submitted_at":"2026-07-21T15:52:30Z","title":"Visual Token Compression Enhances Robustness of MLLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T13:10:37.202730Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2607.22716"},"observation_digest":"sha256:c74799b6d2e00aacc8096790d44d6b840bf2054955dd1a274761939a75e67bb0","observation_id":"2f5f4e4f-4e40-44e3-8325-75d037f4915d","resolution":{"observed_at":"2026-08-01T13:10:37.202730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.03051/citation-record","integrity":"/paper/2410.03051/integrity","json":"/paper/2410.03051/citation-record.json","paper":"/paper/2410.03051"},"outbound":[],"paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2410.03051."}