{"as_of":"2026-08-10T14:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d2f6da446862521c611c667fb4645281ec562ae8cf99f95481601846f55d227d","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:12:41.078055Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:03:28.047281Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:49:30.275005Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20939","snapshot_observed_at":"2026-08-06T00:03:28.047281Z","title":"Arc-hunyuan-video-7b: Structured video comprehension of real-world shorts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04415","last_updated":"2025-08-06T13:03:16Z","snapshot_observed_at":"2026-08-07T20:42:58.746080Z","submitted_at":"2025-08-06T13:03:16Z","title":"Empowering Nanoscale Connectivity through Molecular Communication: A Case Study of Virus Infection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T00:03:28.047281Z"},"links":{"cited_paper":"/paper/2507.20939","citing_paper":"/paper/2508.04415"},"observation_digest":"sha256:a25eaf9a6a2909b9c404e2801403685b7b742b9f73102f6d05dae7c976ade40b","observation_id":"d82c0732-c3fe-44a9-bd50-e5bb579ddea6","resolution":{"observed_at":"2026-08-06T00:03:28.047281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"cited_work":{"arxiv_id":"2507.20939","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20939","snapshot_observed_at":"2026-07-04T03:49:30.275005Z","title":"Arc-hunyuan-video-7b: Structured video comprehension of real-world shorts","venue":null,"work_id":"15d47e6d-cf53-41b3-99f6-6ffb8f089518","year":2025},"citing_paper":{"arxiv_id":"2511.14582","last_updated":"2026-04-20T05:56:36Z","snapshot_observed_at":"2026-07-31T08:04:43.452255Z","submitted_at":"2025-11-18T15:22:32Z","title":"OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T20:45:37.418493Z"},"links":{"cited_paper":"/paper/2507.20939","citing_paper":"/paper/2511.14582"},"observation_digest":"sha256:27152f47c7b4b2838eff9726c22c25118667549123031f68e03efa001497c7ef","observation_id":"016ec883-792f-4898-8ee7-42fd8c75a35d","resolution":{"observed_at":"2026-05-17T20:50:15.022646Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"cited_work":{"arxiv_id":"2507.20939","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20939","snapshot_observed_at":"2026-07-04T03:49:30.275005Z","title":"Arc-hunyuan-video-7b: Structured video comprehension of real-world shorts","venue":null,"work_id":"15d47e6d-cf53-41b3-99f6-6ffb8f089518","year":2025},"citing_paper":{"arxiv_id":"2512.16918","last_updated":"2026-04-28T12:04:04Z","snapshot_observed_at":"2026-08-09T15:59:03.013255Z","submitted_at":"2025-12-18T18:59:55Z","title":"AdaTooler-V: Adaptive Tool-Use for Images and Videos","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T21:23:33.598026Z"},"links":{"cited_paper":"/paper/2507.20939","citing_paper":"/paper/2512.16918"},"observation_digest":"sha256:e959052234f914fb6e99e330bb522ad0902c1bd0e6f459b02a288ef3f4cc7b59","observation_id":"431cd667-1fe8-4634-a1e5-be3605422d64","resolution":{"observed_at":"2026-05-16T21:28:34.444944Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"cited_work":{"arxiv_id":"2507.20939","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20939","snapshot_observed_at":"2026-07-04T03:49:30.275005Z","title":"Arc-hunyuan-video-7b: Structured video comprehension of real-world shorts","venue":null,"work_id":"15d47e6d-cf53-41b3-99f6-6ffb8f089518","year":2025},"citing_paper":{"arxiv_id":"2512.21334","last_updated":"2026-04-10T15:00:46Z","snapshot_observed_at":"2026-08-03T08:10:30.527963Z","submitted_at":"2025-12-24T18:59:36Z","title":"Streaming Video Instruction Tuning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T19:44:11.032898Z"},"links":{"cited_paper":"/paper/2507.20939","citing_paper":"/paper/2512.21334"},"observation_digest":"sha256:4329258720d4dec09fee42587117141c16b866301294701e6b2d3e9ae8fecd95","observation_id":"895f2136-3282-4deb-91f7-27e2bff74873","resolution":{"observed_at":"2026-05-16T19:48:21.809969Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"cited_work":{"arxiv_id":"2507.20939","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20939","snapshot_observed_at":"2026-07-04T03:49:30.275005Z","title":"Arc-hunyuan-video-7b: Structured video comprehension of real-world shorts","venue":null,"work_id":"15d47e6d-cf53-41b3-99f6-6ffb8f089518","year":2025},"citing_paper":{"arxiv_id":"2602.02994","last_updated":"2026-06-02T08:33:06Z","snapshot_observed_at":"2026-08-03T05:14:21.502066Z","submitted_at":"2026-02-03T02:05:48Z","title":"Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T08:38:49.075457Z"},"links":{"cited_paper":"/paper/2507.20939","citing_paper":"/paper/2602.02994"},"observation_digest":"sha256:8eab023c0c1578a3d8d760c8fca79b1f89f8dc9758991f48bd81d6f7279b7f57","observation_id":"30240866-491b-453d-8a29-00fb300b939d","resolution":{"observed_at":"2026-05-16T08:40:46.361256Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20939","snapshot_observed_at":"2026-08-03T05:14:23.065987Z","title":"Arc-hunyuan-video- 7b: Structured video comprehension of real-world shorts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02994","last_updated":"2026-06-02T08:33:06Z","snapshot_observed_at":"2026-08-03T05:14:21.502066Z","submitted_at":"2026-02-03T02:05:48Z","title":"Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T05:14:23.065987Z"},"links":{"cited_paper":"/paper/2507.20939","citing_paper":"/paper/2602.02994"},"observation_digest":"sha256:c35221907bc1a5f2aa4e77d2c86d1b339ebf5b0a1b8a12cef5323101ae7777d6","observation_id":"0d5a81a4-f4a7-4ce7-9d4f-f670f02cb94f","resolution":{"observed_at":"2026-08-03T05:14:23.065987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"cited_work":{"arxiv_id":"2507.20939","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20939","snapshot_observed_at":"2026-07-04T03:49:30.275005Z","title":"Arc-hunyuan-video-7b: Structured video comprehension of real-world shorts","venue":null,"work_id":"15d47e6d-cf53-41b3-99f6-6ffb8f089518","year":2025},"citing_paper":{"arxiv_id":"2604.11102","last_updated":"2026-04-13T07:19:27Z","snapshot_observed_at":"2026-08-05T04:07:22.236608Z","submitted_at":"2026-04-13T07:19:27Z","title":"OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T15:35:23.842691Z"},"links":{"cited_paper":"/paper/2507.20939","citing_paper":"/paper/2604.11102"},"observation_digest":"sha256:8d9401cf4bec36f16f604b47a4e1041f05d102c8a6cb07daa23da54f824e1ca3","observation_id":"2f3689b5-1689-4621-8177-8e9a4589739a","resolution":{"observed_at":"2026-05-11T10:11:13.095482Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"cited_work":{"arxiv_id":"2507.20939","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20939","snapshot_observed_at":"2026-07-04T03:49:30.275005Z","title":"Arc-hunyuan-video-7b: Structured video comprehension of real-world shorts","venue":null,"work_id":"15d47e6d-cf53-41b3-99f6-6ffb8f089518","year":2025},"citing_paper":{"arxiv_id":"2604.23198","last_updated":"2026-04-25T08:09:31Z","snapshot_observed_at":"2026-07-06T23:09:29.537323Z","submitted_at":"2026-04-25T08:09:31Z","title":"StoryTR: Narrative-Centric Video Temporal Retrieval with Theory of Mind Reasoning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-08T08:04:15.238840Z"},"links":{"cited_paper":"/paper/2507.20939","citing_paper":"/paper/2604.23198"},"observation_digest":"sha256:6c1fde7cb3d5582db25057723a433076105712ec85be94857671dd2c2608304e","observation_id":"110d5eda-42cd-4a0c-a706-ced4bcebc4c6","resolution":{"observed_at":"2026-05-11T20:46:13.636648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"cited_work":{"arxiv_id":"2507.20939","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20939","snapshot_observed_at":"2026-07-04T03:49:30.275005Z","title":"Arc-hunyuan-video-7b: Structured video comprehension of real-world shorts","venue":null,"work_id":"15d47e6d-cf53-41b3-99f6-6ffb8f089518","year":2025},"citing_paper":{"arxiv_id":"2605.12056","last_updated":"2026-05-12T12:42:44Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:42:44Z","title":"OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T04:52:03.076788Z"},"links":{"cited_paper":"/paper/2507.20939","citing_paper":"/paper/2605.12056"},"observation_digest":"sha256:fef0faaf3b1d1c3714bd678adf12a93d6752d9d22d59b0903238e14825f66098","observation_id":"87b80d37-3a54-4c85-9892-6f7cf8472eb7","resolution":{"observed_at":"2026-05-13T04:52:16.273746Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"cited_work":{"arxiv_id":"2507.20939","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20939","snapshot_observed_at":"2026-07-04T03:49:30.275005Z","title":"Arc-hunyuan-video-7b: Structured video comprehension of real-world shorts","venue":null,"work_id":"15d47e6d-cf53-41b3-99f6-6ffb8f089518","year":2025},"citing_paper":{"arxiv_id":"2605.20035","last_updated":"2026-05-19T15:55:16Z","snapshot_observed_at":"2026-07-06T23:30:39.512029Z","submitted_at":"2026-05-19T15:55:16Z","title":"Stage-adaptive Token Selection for Efficient Omni-modal LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T06:05:44.739490Z"},"links":{"cited_paper":"/paper/2507.20939","citing_paper":"/paper/2605.20035"},"observation_digest":"sha256:323f80dcebdfc32f2f630fd0ffcf7a7173ace08a12caf4c2bddb8bbb1ff7b273","observation_id":"a522d834-08cb-4dae-914a-d4ee04358f2d","resolution":{"observed_at":"2026-05-20T06:08:04.999290Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"cited_work":{"arxiv_id":"2507.20939","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20939","snapshot_observed_at":"2026-07-04T03:49:30.275005Z","title":"Arc-hunyuan-video-7b: Structured video comprehension of real-world shorts","venue":null,"work_id":"15d47e6d-cf53-41b3-99f6-6ffb8f089518","year":2025},"citing_paper":{"arxiv_id":"2605.26584","last_updated":"2026-05-26T06:07:11Z","snapshot_observed_at":"2026-08-06T08:54:48.250441Z","submitted_at":"2026-05-26T06:07:11Z","title":"O-MARC: Omni Memory-Augmented Compression Distillation for Efficient Video Understanding","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-29T18:36:29.376048Z"},"links":{"cited_paper":"/paper/2507.20939","citing_paper":"/paper/2605.26584"},"observation_digest":"sha256:d68d25bd9a4db86a88943e9a8fba18ec4901a46ebc709401a2af8be15e561b3e","observation_id":"0f3610da-8dd6-4be3-aadc-32053dd315be","resolution":{"observed_at":"2026-06-29T18:43:50.865844Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"cited_work":{"arxiv_id":"2507.20939","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20939","snapshot_observed_at":"2026-07-04T03:49:30.275005Z","title":"Arc-hunyuan-video-7b: Structured video comprehension of real-world shorts","venue":null,"work_id":"15d47e6d-cf53-41b3-99f6-6ffb8f089518","year":2025},"citing_paper":{"arxiv_id":"2606.20970","last_updated":"2026-06-18T22:17:18Z","snapshot_observed_at":"2026-08-01T20:10:55.070907Z","submitted_at":"2026-06-18T22:17:18Z","title":"CogniRoute: Learning to Route Social Evidence in Omni-Modal Models","version":1},"reference_index":107,"source":"arxiv_source","source_observed_at":"2026-06-26T17:37:11.371892Z"},"links":{"cited_paper":"/paper/2507.20939","citing_paper":"/paper/2606.20970"},"observation_digest":"sha256:2a65c9d29801c37f99956f5ac85fdef501915eef6d505a0abd301dcc00497e32","observation_id":"f4ef4a4c-eac4-4efb-a123-54a804582313","resolution":{"observed_at":"2026-07-04T03:49:30.276794Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"cited_work":{"arxiv_id":"2507.20939","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20939","snapshot_observed_at":"2026-07-04T03:49:30.275005Z","title":"Arc-hunyuan-video-7b: Structured video comprehension of real-world shorts","venue":null,"work_id":"15d47e6d-cf53-41b3-99f6-6ffb8f089518","year":2025},"citing_paper":{"arxiv_id":"2606.31187","last_updated":"2026-06-30T06:16:17Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T06:16:17Z","title":"Learning to Deny: Action Denial in Multimodal Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-01T06:21:09.996386Z"},"links":{"cited_paper":"/paper/2507.20939","citing_paper":"/paper/2606.31187"},"observation_digest":"sha256:2bd919b749426ed86f82aa1abdaf4fe03d1783cbbfee79ee08f4f63ac5d116a0","observation_id":"f5d9aaa1-58f1-450d-aa96-2d51e362a60a","resolution":{"observed_at":"2026-07-01T09:45:39.578572Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"cited_work":{"arxiv_id":"2507.20939","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20939","snapshot_observed_at":"2026-07-04T03:49:30.275005Z","title":"Arc-hunyuan-video-7b: Structured video comprehension of real-world shorts","venue":null,"work_id":"15d47e6d-cf53-41b3-99f6-6ffb8f089518","year":2025},"citing_paper":{"arxiv_id":"2607.01667","last_updated":"2026-07-02T03:47:45Z","snapshot_observed_at":"2026-08-05T09:34:18.453279Z","submitted_at":"2026-07-02T03:47:45Z","title":"Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-03T16:37:06.384435Z"},"links":{"cited_paper":"/paper/2507.20939","citing_paper":"/paper/2607.01667"},"observation_digest":"sha256:d72d01ba659fa1f11ad3792e4f0c37543e3c4cd7eab6f4dab0bd0ce6f0f80bc8","observation_id":"b1162d31-7bdc-41ae-b96f-3fdc4ef55fc5","resolution":{"observed_at":"2026-07-03T16:38:39.611522Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20939","snapshot_observed_at":"2026-07-12T05:48:27.255331Z","title":"arXiv preprint arXiv:2507.20939 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02963","last_updated":"2026-07-03T05:13:19Z","snapshot_observed_at":"2026-08-09T08:34:06.125045Z","submitted_at":"2026-07-03T05:13:19Z","title":"Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T05:48:27.255331Z"},"links":{"cited_paper":"/paper/2507.20939","citing_paper":"/paper/2607.02963"},"observation_digest":"sha256:8ccb8ec724cfe3f18ed1f17a51439a7693e73c35df0e5f569abd74c712c18f4a","observation_id":"182b0ee0-427f-43da-aee5-3e1c50ac9f1e","resolution":{"observed_at":"2026-07-12T05:48:27.255331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20939","snapshot_observed_at":"2026-08-01T10:02:03.165633Z","title":"ARC-Hunyuan-Video-7B: structured video comprehension of real-world shorts.CoRR, abs/2507.20939, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20389","last_updated":"2026-07-22T17:17:33Z","snapshot_observed_at":"2026-08-07T12:38:32.377959Z","submitted_at":"2026-07-22T17:17:33Z","title":"PercepCap: Video Captioner with Structured Spatio-Temporal Perception","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T10:02:03.165633Z"},"links":{"cited_paper":"/paper/2507.20939","citing_paper":"/paper/2607.20389"},"observation_digest":"sha256:0b0929279a945bc2b718f549b3ab31ec755c1482c6000ed939d4a18e2d430602","observation_id":"e773c642-522a-4375-8026-1b9b52077a05","resolution":{"observed_at":"2026-08-01T10:02:03.165633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20939","snapshot_observed_at":"2026-07-31T05:08:19.828792Z","title":"ARC-Hunyuan- Video-7B: Structured video comprehension of real-world shorts.arXiv preprint arXiv:2507.20939, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:19.828792Z"},"links":{"cited_paper":"/paper/2507.20939","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:5580703095b29c1ff9c3f0f21c73b213b225beada95b757459aa71222eba75e6","observation_id":"6d25759c-5f23-49ae-9276-95bc2c367031","resolution":{"observed_at":"2026-07-31T05:08:19.828792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20939","snapshot_observed_at":"2026-08-04T23:23:37.839045Z","title":"Yuying Ge, Yixiao Ge, Chen Li, Teng Wang, Junfu Pu, Yizhuo Li, Lu Qiu, Jin Ma, Lisheng Duan, Xinyu Zuo, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01665","last_updated":"2026-08-03T03:56:33Z","snapshot_observed_at":"2026-08-09T21:05:15.058403Z","submitted_at":"2026-08-03T03:56:33Z","title":"Allocation Before Ranking: Decoupled Token Compression for OmniLLMs","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T23:23:37.839045Z"},"links":{"cited_paper":"/paper/2507.20939","citing_paper":"/paper/2608.01665"},"observation_digest":"sha256:630de57d412ae9cb97fada8de3c90de8fa4fc433e094b9d86531a5c3b6e1aae2","observation_id":"70c59f4e-51a2-44fa-bca1-f081081e2100","resolution":{"observed_at":"2026-08-04T23:23:37.839045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20939","snapshot_observed_at":"2026-08-05T12:00:10.785575Z","title":"Arc-hunyuan-video-7b: Structured video comprehension of real-world shorts.arXiv preprint arXiv:2507.20939, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.785575Z"},"links":{"cited_paper":"/paper/2507.20939","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:0d7a74b6591d66a929fc35645f3e778c4c819373277f2073e3412234ce90fdc5","observation_id":"df338285-baa2-473b-a284-b677b5a98a8e","resolution":{"observed_at":"2026-08-05T12:00:10.785575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.20939/citation-record","integrity":"/paper/2507.20939/integrity","json":"/paper/2507.20939/citation-record.json","paper":"/paper/2507.20939"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T13:12:39.360764Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:12:39.360764Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.20939"},"observation_digest":"sha256:40d4c1a8a61d40e456c325a675165ec4d568c9b10a4dfc6302f1240b204dc4ba","observation_id":"09faad0a-b366-49d8-9cb6-2caf2d9a1b54","resolution":{"observed_at":"2026-08-06T13:12:39.360764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-06T13:12:39.953417Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension.arXiv preprint arXiv:2307.16125,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:12:39.953417Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2507.20939"},"observation_digest":"sha256:74729329540b48f5fdd879d785ed0c945f89a307c9dba8159a1ea3591d0569ee","observation_id":"7548790d-90d4-4c51-8750-4ca490328737","resolution":{"observed_at":"2026-08-06T13:12:39.953417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04447","last_updated":"2025-04-11T07:10:02Z","snapshot_observed_at":"2026-08-06T02:13:58.479161Z","submitted_at":"2024-12-05T18:57:23Z","title":"EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04447","snapshot_observed_at":"2026-08-06T13:12:40.150961Z","title":"Egoplan-bench2: A benchmark for multimodal large language model planning in real-world scenarios.arXiv preprint arXiv:2412.04447,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:12:40.150961Z"},"links":{"cited_paper":"/paper/2412.04447","citing_paper":"/paper/2507.20939"},"observation_digest":"sha256:2f3241790e1e0e43bb1fd140bde45ff891ff098938ea9bb9800c3b49336ff14d","observation_id":"9b6c2843-4cbc-4135-a943-43880b395e63","resolution":{"observed_at":"2026-08-06T13:12:40.150961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-08-06T13:12:40.249511Z","title":"Audio-visual llm for video understanding.arXiv preprint arXiv:2312.06720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:12:40.249511Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2507.20939"},"observation_digest":"sha256:fbe87d2768673784d975e63aa8db7605fa3f306bd84386acc60e1e7f0335e2d2","observation_id":"b4a0a645-4785-4ba4-a8bd-573947db35c1","resolution":{"observed_at":"2026-08-06T13:12:40.249511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-08-10T14:48:46.746614Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-08-06T13:12:40.387502Z","title":"video-salmonn: Speech-enhanced audio-visual large language models.arXiv preprint arXiv:2406.15704,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:12:40.387502Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2507.20939"},"observation_digest":"sha256:cd0c3432bf04b9067b25747263f6e2fb124ef3c76df0642106f59b0ff31aa202","observation_id":"121a0ef3-6a52-41a4-83b9-bcc9bd4d0e63","resolution":{"observed_at":"2026-08-06T13:12:40.387502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11775","last_updated":"2025-02-17T13:07:40Z","snapshot_observed_at":"2026-08-09T14:00:25.020138Z","submitted_at":"2025-02-17T13:07:40Z","title":"video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11775","snapshot_observed_at":"2026-08-06T13:12:40.512824Z","title":"video- salmonn-o1: Reasoning-enhanced audio-visual large language model.arXiv preprint arXiv:2502.11775,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:12:40.512824Z"},"links":{"cited_paper":"/paper/2502.11775","citing_paper":"/paper/2507.20939"},"observation_digest":"sha256:c46093c4579ad4e868a78c5fa34557ee6d554605ff8134126f90db755ce85e82","observation_id":"f9929eab-f34d-4ddf-99e4-742369172e99","resolution":{"observed_at":"2026-08-06T13:12:40.512824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:12:40.594915Z","title":"video- salmonn 2: Captioning-enhanced audio-visual large language models.arXiv preprint arXiv:2506.15220,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:12:40.594915Z"},"links":{"citing_paper":"/paper/2507.20939"},"observation_digest":"sha256:9fd778580a3d483114596135e0ffa2bfecb5d3e7a72cdd76e359c785db1ef66d","observation_id":"cd8c78b8-5b4e-411d-a750-cbaf2e8ec76f","resolution":{"observed_at":"2026-08-06T13:12:40.594915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-06T20:37:19.866170Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-08-06T13:12:40.675805Z","title":"Kwai keye-vl technical report.arXiv preprint arXiv:2507.01949,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:12:40.675805Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2507.20939"},"observation_digest":"sha256:01e137083f3c522a5997d29a14df05220309399eabd5f80e25cb1fc0a4889486","observation_id":"36e2cfcd-788a-4d8c-85b5-7d2114fb4bea","resolution":{"observed_at":"2026-08-06T13:12:40.675805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T13:12:40.870798Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding.arXiv preprint arXiv:2306.02858,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:12:40.870798Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2507.20939"},"observation_digest":"sha256:19ac5f709bee218784d3d11b64903057f5d53c5e3e814f72b02f8f662ec256ba","observation_id":"d90faea1-3e4d-4f84-9b8d-1851eb24d599","resolution":{"observed_at":"2026-08-06T13:12:40.870798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:12:41.566109Z","title":"Self-supervised product title rewrite for product listing ads","venue":null,"work_id":"d2024772-1045-4c36-b9fc-7117a4e266b4","year":2022},"citing_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:12:40.971685Z"},"links":{"citing_paper":"/paper/2507.20939"},"observation_digest":"sha256:a8c92daba2c92b471c842f43076013494c0d55e6428f68ab4fc6b0b0ffd58a38","observation_id":"7e81c92a-5039-4fec-b214-1c1dc739921b","resolution":{"observed_at":"2026-08-06T13:12:41.674677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:12:41.407890Z","title":"Pre-trained language model based ranking in baidu search","venue":null,"work_id":"56db3e0d-35ec-4a45-8f5c-3091a3120012","year":2021},"citing_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:12:41.078055Z"},"links":{"citing_paper":"/paper/2507.20939"},"observation_digest":"sha256:d605cbecd6c5f7028fbe96354b48b88260e7b0e15a16cdeb659868c60deda3a9","observation_id":"0330b3b7-885f-4f0f-b3ed-c34643bedbe1","resolution":{"observed_at":"2026-08-06T13:12:41.484033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06722","last_updated":"2024-06-11T06:53:44Z","snapshot_observed_at":"2026-08-09T01:06:11.036691Z","submitted_at":"2023-12-11T03:35:58Z","title":"EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06722","snapshot_observed_at":"2026-08-06T13:12:39.428823Z","title":"Egoplan- bench: Benchmarking multimodal large language models for human-level planning.arXiv preprint arXiv:2312.06722,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T13:12:39.428823Z"},"links":{"cited_paper":"/paper/2312.06722","citing_paper":"/paper/2507.20939"},"observation_digest":"sha256:26151d58e0216a547356a2d6e38af67a18f351af3fee88fcfb2bd3a803bdbc81","observation_id":"19e9010d-dacf-4543-9715-976def34db69","resolution":{"observed_at":"2026-08-06T13:12:39.428823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T13:12:39.878853Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T13:12:39.878853Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.20939"},"observation_digest":"sha256:f9dd140fe0b8d373e8fe8ba1018d7f899043a7f18bc4625e4b00ad68c00cd3cf","observation_id":"83b99e30-bf69-4500-bbe8-019717c45630","resolution":{"observed_at":"2026-08-06T13:12:39.878853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-10T01:47:37.707753Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-08-06T13:12:39.766732Z","title":"Clip2video: Mastering video-text retrieval via image clip.arXiv preprint arXiv:2106.11097,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T13:12:39.766732Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2507.20939"},"observation_digest":"sha256:7089788c041b77579a9fc23e3d33f1fa79cc2924ea6a7f4709fea10d5a7ce85a","observation_id":"8adc1884-5841-4d92-9623-872b8dd0785b","resolution":{"observed_at":"2026-08-06T13:12:39.766732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07956","last_updated":"2025-04-10T17:59:03Z","snapshot_observed_at":"2026-08-07T16:06:45.494945Z","submitted_at":"2025-04-10T17:59:03Z","title":"VCR-Bench: A Comprehensive Evaluation Framework for Video Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07956","snapshot_observed_at":"2026-08-06T13:12:40.063831Z","title":"Vcr-bench: A comprehensive evaluation framework for video chain-of-thought reasoning.arXiv preprint arXiv:2504.07956,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T13:12:40.063831Z"},"links":{"cited_paper":"/paper/2504.07956","citing_paper":"/paper/2507.20939"},"observation_digest":"sha256:4bf30b68242c7ebcc26619d8b10bfe6d9d9d90b05f54a1366f8c56d643f4ebd0","observation_id":"4bb1c417-c44c-49eb-b3bd-7193a9df94e0","resolution":{"observed_at":"2026-08-06T13:12:40.063831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-06T13:12:40.757999Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T13:12:40.757999Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2507.20939"},"observation_digest":"sha256:2a7816878f02714725f870c6bb25c5b0e156da544690ef01f90cb5e84f103836","observation_id":"929118e3-4139-417a-8134-569457a97108","resolution":{"observed_at":"2026-08-06T13:12:40.757999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T13:12:39.499439Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T13:12:39.499439Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.20939"},"observation_digest":"sha256:f160f001d8adcb0be458337831975ca157591bcf840fa5786cbfd7c9c290cb26","observation_id":"ef3698a5-928b-43b8-b734-8e05bca71011","resolution":{"observed_at":"2026-08-06T13:12:39.499439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21374","last_updated":"2025-05-27T16:05:01Z","snapshot_observed_at":"2026-08-06T04:32:21.352745Z","submitted_at":"2025-05-27T16:05:01Z","title":"Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21374","snapshot_observed_at":"2026-08-06T13:12:39.601562Z","title":"Video-holmes: Can mllm think like holmes for complex video reasoning?arXiv preprint arXiv:2505.21374,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T13:12:39.601562Z"},"links":{"cited_paper":"/paper/2505.21374","citing_paper":"/paper/2507.20939"},"observation_digest":"sha256:c437444122abbd6b5522349d288d1d639905286c0ca09cddc365bfc9ad57852d","observation_id":"17226eaf-2214-427b-b571-910ed26a187a","resolution":{"observed_at":"2026-08-06T13:12:39.601562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T13:12:39.679158Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T13:12:39.679158Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.20939"},"observation_digest":"sha256:fada45bdb8658c121e6c567ca934df83702f592c408c3f57cc7693c4e6d29111","observation_id":"7da6f7e7-2ed8-4976-b4ca-a5e4d7ee1be7","resolution":{"observed_at":"2026-08-06T13:12:39.679158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 19 inbound Pith citation observations for arXiv:2507.20939."}