{"as_of":"2026-08-14T20:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5f92ae206ee9b6cc7c5ce451f1d29b0e6cf9fc61ae1ac40a88c8ed4d5717bb1e","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T05:16:19.750976Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.03043/citation-record","integrity":"/paper/2607.03043/integrity","json":"/paper/2607.03043/citation-record.json","paper":"/paper/2607.03043"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:26068b905d931e1c0d9393200ea0b2c3c2ea63613114179570b6fe873da898c7","observation_id":"1b727b7a-7f98-47ea-8797-66abcd2a1c82","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"arXiv preprint arXiv:2511.21631 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:6c6ee0cefe1151334d02ef5d2f2ec0e5a35b9940865235158047fe98b131cdbf","observation_id":"d24385e7-460d-4663-a2be-9edb090178e5","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:5492ead3cf64b7844f92a98c18362519f7c0aca9c056d7d6f1f40faa31d4e23e","observation_id":"fdfa2c51-aa79-4ab1-98d5-d07faad356ce","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":null,"venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:554c3e96a4f1427d8bf5a73aee5b0849476cee2714809bd34b70f0ee079083f9","observation_id":"baae4bfe-6264-43b2-9c17-bfe9df288739","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:7e9ae04b77281bf779fc13fca98af5ec55918fd75e61d30d3f7f526483597abb","observation_id":"7c94e361-680b-4adc-9103-dd96cd5224b9","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"Routledge (2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:4aba880d1dddf1629b0d359d306b0421bf259eaa7de6a00d2d4946a016a9dff9","observation_id":"ef7e5563-ad56-4a05-9e18-2538d91b7989","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"arXiv preprint arXiv:2506.01674 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:aab3e24f99b38b5812a9386a89e02c91be846d1ab5b34b9f7cdbda32f467c0eb","observation_id":"e9f20202-1017-4276-84b4-0c7a6411270b","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"arXiv preprint arXiv:2505.20279 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:edd4b1572e95fcc7952495ae6ae091ee56e6ccd7b96e993bdf617a77e3238df5","observation_id":"019ffe8c-56e7-4c01-8659-fb28a604c152","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"google / models / veo/(2024), last accessed 2026/06/29","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:c299cd4f1b5b25d21808054a5a7322f58998424a012c0e4a5b837c34a8a706dd","observation_id":"463d444f-6abe-48f1-a6ef-9cd971dbf537","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:fc9aa768abe385f8bd1598a14a6b00080a7178338bce1316b6af499098da399d","observation_id":"76af89db-a13c-49da-84ca-0913551c5167","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"arXiv preprint arXiv:2511.21688 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:8c77ed442adce28f4f9f8c4a01f22e3806ef698742bfeded75740eacc4a14767","observation_id":"9f5e2ddc-77dc-4208-b977-04041ebfd65f","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10934","last_updated":"2025-08-12T18:39:13Z","snapshot_observed_at":"2026-08-14T06:25:22.731553Z","submitted_at":"2025-08-12T18:39:13Z","title":"ViPE: Video Pose Engine for 3D Geometric Perception","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10934","snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"arXiv preprint arXiv:2508.10934 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"cited_paper":"/paper/2508.10934","citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:1a4efacc89aed3bf6a2111b62f337d371a5f40fa5dfd0aed2b631212e52ab438","observation_id":"6e909dc1-1cde-4dce-8b22-1afaed5412f1","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:8b71cc0c3d4bc21c8ead2c1d4be43c5a8d8361db3ebd1bd35d9557fd843c9d74","observation_id":"5a7563f6-3b54-407d-b1eb-afbebc90bfd7","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"In: Proceedings of the 33rd ACM International Conference on Multimedia","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:a91a71457d7a1415801317f32cee91c8e9077ad280099000c1dd97a858759a1a","observation_id":"aab4fe51-1dcf-487c-a3c5-536d8a7c4b4d","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"Columbia University Press (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:5ba288bc7e696421ddc50b26f9827fb201fad3df5aee7c686dda7ca679741a23","observation_id":"279fe19f-7bc9-4503-9b2b-c9e401418d00","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-13T14:41:45.809481Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"arXiv preprint arXiv:2412.03603 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:b296e33b763c14c0a99ae01718ab64c6c580937c8d7d58c6de444914ab7b6b85","observation_id":"699142f5-0dd2-4e47-a6c1-b3489e3fb3f9","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:8c141970fed4c81f1b723f05cd51ad1316207f66f80f1305141666a32ff531cd","observation_id":"0c2f5e17-7842-4cad-b605-3502649dc783","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:58654c3ea8522b9e82ced85ed1b94b9bb74376db2e7cc40c6526909400b108da","observation_id":"32e7ac82-dedf-41b2-aad9-345b4388c2b6","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12223","last_updated":"2025-03-28T03:50:25Z","snapshot_observed_at":"2026-08-14T03:18:45.580820Z","submitted_at":"2024-12-16T09:02:24Z","title":"Can video generation replace cinematographers? Research on the cinematic language of generated video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12223","snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"arXiv preprint arXiv:2412.12223 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"cited_paper":"/paper/2412.12223","citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:2b70d01fe377948bf5a73bb2b8338974b9bdce9f5c9eac5076b2bdea3f7f7056","observation_id":"57df0b89-4c9c-4c6a-8a6a-1aac18ca925e","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:a256d5afaa24717d1676233fad08067d202137f03a7aae0a47daa4dcc3483f7c","observation_id":"b6385e3b-8b23-4323-9a2b-36bf4a2bff09","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-07T16:00:29.105170Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15376","snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"arXiv preprint arXiv:2504.15376 (2025) Natural Language Camera Movement Understanding 17","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"cited_paper":"/paper/2504.15376","citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:1451d52cf20a0deaaeb4ca0a886e0d4314422bd5f4af388c6bac3c6bbcacee34","observation_id":"91c0c318-7fc0-4dc1-a37a-11ee04506787","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"arXiv preprint arXiv:2506.21356 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:8dcd61c0ab23532f34b4f93952663525c9775dcc50e2ce815befc4a8e42c9a2d","observation_id":"c7f2f435-d64e-4fdf-b2b3-1437a3616a19","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:da1e8551305263e0d1697eb4d18130e1d76dd4faf85d1d0aa83fd818101351c4","observation_id":"2ea7abfb-0854-48e3-86af-80dc82fb4092","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"arXiv preprint arXiv:2503.02341 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:ed24e53d4da840f6447fc9091a2482e964467283f2f04f5f6e9b9d32d6a17534","observation_id":"a5e3d088-e662-4ee0-8c55-9c28b226e052","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"Department of Inf","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:ae51812cedac0dcf67ec6d079ff6a4babb8c6c605ba3663c1fe946d79894bdea","observation_id":"072efca4-3059-4cf4-a88b-461e2075abce","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"arXiv preprint arXiv:2410.21276 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:fce68e656132a2ac116ba1415fc73ab18644954f0311c6d2419b09994018032b","observation_id":"594be62e-3afc-43a7-8060-0b9ca56fcba3","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:bfa70529ea8d4c9787ab0ba7152add1fa6caf1f849e723f1364d3a5ce5cdd8f3","observation_id":"1caa2193-35b0-4d66-b47a-78ddcba1ba4b","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:951607709b74b4565bc819d37bb11a200807bc08dc96a32f7e1ee5555314b447","observation_id":"57014fea-1747-46f8-9547-c4a3d53a60e5","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"Data in Brief51, 109627 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:da591a20f43726d011f31c8cabcfacd2d30c69f89cd54bb46c948af2e671887e","observation_id":"585d6399-5678-4bfd-878d-d4d94932c27c","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:23efd4fb0ccfe7551ec6c9bbc57bfd8ba59a3a2191d0d050241b8288a276a8c4","observation_id":"5ee53e17-cc56-4137-8c9d-0fbcde85153e","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"arXiv preprint arXiv:2601.03267 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:acae59646fc92a1a6de925e28ae9f12c5767945b7d6f048cbb3981a86b29fca7","observation_id":"f46fe5ab-77fa-4177-b6c6-0e86cb30e183","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"Univ of California Press (1969)","venue":null,"work_id":null,"year":1969},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:50eee3aaba22a887cce90c93bdb96c50f64e3fff3a04a4c7a5dce58e7fa7873e","observation_id":"18d6ef74-5890-4670-8038-756a9c8cf430","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"In: Proceed- ings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:28deb324e94cf58225b70014c3cb7aedc0faaade43d110bcc413f448c50ac5ee","observation_id":"8994462e-afba-4b57-a7e8-7f8aa465701f","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:a4c8189299dcb3598ca07852034f50bc36e51eaffcb070b8cb501cc6f3d4c73b","observation_id":"fbdd5e57-da01-4a05-a017-db39495e45c1","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"arXiv preprint arXiv:2312.11805 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:eb8b4ee8209a3a63febce9e4fd13081cca4e3bbd11528d8e1e9a503045234204","observation_id":"6987e478-d118-40c1-b8f5-6d1be10cf2b8","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14935","last_updated":"2025-03-19T06:42:32Z","snapshot_observed_at":"2026-08-14T07:25:14.294565Z","submitted_at":"2025-03-19T06:42:32Z","title":"FAVOR-Bench: A Comprehensive Benchmark for Fine-Grained Video Motion Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14935","snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"arXiv preprint arXiv:2503.14935 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"cited_paper":"/paper/2503.14935","citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:73cb00bf5d0cdf2776946a621b4452df842e6f17c30b56b659479d20d224f8a6","observation_id":"268cee1b-0b84-4d96-bd0d-fd0148dd69f6","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"arXiv preprint arXiv:2503.20314 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:22ff227861a3402df8f865ec9e5865e469c8eee7e2fe08366260caa982f83b75","observation_id":"185ae5e6-3d72-4d16-bfc3-dc14a033f16d","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"arXiv preprint arXiv:2509.09676 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:389333815075d4ae18a29e82e052d02ad07056af9a7b583dcdc67df4e5998952","observation_id":"3749f74c-1d82-40ae-b662-1b20f8ebcb78","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:8fc0df22d7006325e828c5ffc0b7ed3171a5ffb389b23f89fd9834549b602220","observation_id":"8f9d8d37-df4e-425e-af79-b9165943f2aa","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12098","last_updated":"2025-05-17T17:49:26Z","snapshot_observed_at":"2026-08-12T20:45:44.532740Z","submitted_at":"2025-05-17T17:49:26Z","title":"LOVE: Benchmarking and Evaluating Text-to-Video Generation and Video-to-Text Interpretation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12098","snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"arXiv preprint arXiv:2505.12098 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"cited_paper":"/paper/2505.12098","citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:cb6db340659edd5d7f44b7d0aeaf08c43a63cc071104fedf06e45f29c3ed300f","observation_id":"7de1b9a1-3abf-4470-b2b2-10d662cad8e8","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:9eccf151b7573a22c5505af582c082f8b643fdb8afea313a2cb38e03e9970c99","observation_id":"fa58c64b-1110-429d-a516-ebe94ff80777","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-13T04:48:56.237545Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"5: Advancing open-source multimodal models in versatility, reasoning, and efficiency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:b5eab88aeacacb620b0d2c44cf7049d7a9f31af4392960342bf428f5196e9092","observation_id":"742c88c6-7030-49de-a917-33663c98bf6d","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15145","last_updated":"2025-05-21T06:02:39Z","snapshot_observed_at":"2026-08-13T16:50:10.752927Z","submitted_at":"2025-05-21T06:02:39Z","title":"CineTechBench: A Benchmark for Cinematographic Technique Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15145","snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"arXiv preprint arXiv:2505.15145 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"cited_paper":"/paper/2505.15145","citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:3ff4b4ba05b105c9139896ba5de13095a699425366bdb0620b4c766531463758","observation_id":"af469898-4a5d-439c-bae0-8d4b4949526b","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"5: Empowering video mllms with long and rich context modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:5f85255dfb331b7014edde361b2e00f44fee98bd4f09ae9ae21a87eb4f1c2850","observation_id":"5e8d3556-65e6-4e26-8f18-241baa4085a2","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23747","last_updated":"2026-05-19T02:23:16Z","snapshot_observed_at":"2026-08-12T18:05:43.082727Z","submitted_at":"2025-05-29T17:59:04Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23747","snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"arXiv preprint arXiv:2505.23747 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"cited_paper":"/paper/2505.23747","citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:a0075e108b02e1b870e62a717e15e562e8f0f9313be7ff9134122b31b310496c","observation_id":"0029ab28-f0a8-488a-b18e-0644ef33fba2","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"arXiv preprint arXiv:2510.02423 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:7ab71058e4a57b891df45d9df2c50304279fba7db36a9057a943ace60a601b35","observation_id":"10527a0a-986e-4b9f-b052-fbb7a29443f4","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.00181","last_updated":"2026-04-14T16:44:13Z","snapshot_observed_at":"2026-07-06T22:43:50.689500Z","submitted_at":"2026-01-30T04:45:43Z","title":"CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.00181","snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"arXiv preprint arXiv:2602.00181 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"cited_paper":"/paper/2602.00181","citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:d70a48eb54aad941ac06e7ad206f9a1bd5afa6ffef09297e54cd84556d5f2dfd","observation_id":"22fd0af6-164c-4649-b806-220a5e634e74","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"arXiv preprint arXiv:2408.06072 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:6d4e4c8098f6b3d533a9c6db58743af7cf65a30bc975379159ed2f535ce8aa78","observation_id":"7ba4d20b-c7d4-4056-8587-7b9b09efcef6","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:24394788767a0431f2991e78d484cd98c891cf66cd1c2d6391ffcfb7a8903759","observation_id":"f97582f7-e985-419f-baf7-4ca9f1ec4afd","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:2d78aad412f65e3b24bc4df7ad26940d2d145801c7a5fae98a710be904d81893","observation_id":"26a5952d-5a7c-4215-8578-7ebbe117f45a","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"Slowly dolly in,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:adf92032fd9191a8e5f60e21fd6acee69d8491b9918ac1e6cd791757727928a6","observation_id":"ca261d4d-f63c-45c3-ade5-c4a19093c3af","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:ac17a67df87678da52e529898716567331b522d6bc2f3b870fc40d77f4637357","observation_id":"1f2c608f-e7f8-4e96-83e1-e0f387f92bdf","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:43ed8e05ec44dcec46812e71e9dcf6c8d4acfa2c11a7f6d51cc679193ec5f11e","observation_id":"4b99c7b9-e3ab-4064-ac05-4399efd55824","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:18030611bd4e326ea5a9210a22c03cc2a7959e10e1b035e96570764e67ab936e","observation_id":"dee7a3bd-0b2d-4932-93a0-1a1bb2196337","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"Subject:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:8c19b8390793b70bb536089e4a32968c088739f935578efbc23642092cdec947","observation_id":"39f2a249-7b7b-4bc2-acea-0d260a446a9f","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"Pan left,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:62ee5b5cb2d19f7d37f69d4d261c19b24ce5f2308f65408d2374013283fbc394","observation_id":"dc3b683f-8efd-4dbf-afec-1112dab6a96e","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"following","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:0e10192b6e12ba056f176128bcc76eeb911bfc482f314b247914cfb8e9734992","observation_id":"44ac06ab-2cdf-4152-8c56-d86929521188","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:86c814c40dca5450cd23fabd174cf7c49ca9cd051baa37befe9c7049b6397355","observation_id":"ca92ad80-c86f-4034-9f85-ea71b1fd0e6f","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:3e42f26f4078cf82f3768955f1ba075e41a6cdeb7832164b05bbe15a25490d2d","observation_id":"4b5cfd2a-10a5-4d8e-a0f8-d86a633a9815","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:9ff3a8fd0430710511cad5d3f0b4e98395c1530ba349b94047656670b66e123a","observation_id":"493696c5-5aec-495b-93ef-0dec45b22760","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:7cc68cd0050153661486f4caa5892b1f1df9644f7fd8fdfc1abacbe4bec4feb6","observation_id":"ad5c14ba-59f0-4e13-9ab6-42d653dc320b","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:391627e4b2439227ef0dcca747d54f152e15d007cb4478976d7e00ae295a4aba","observation_id":"3951ca7d-1550-415f-b0de-55b261c2c571","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"\"\" Fig. 15:System prompt used to prompt Gemini-3-Pro to refine the generated captions for improved clarity. 28 Y. Tan et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:57594f12d08751f844647f69da77ccd4d838708922b0790d3a8036e8ec260d08","observation_id":"0f42bec6-8b01-4148-b92a-886f42b54998","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"Zoom\", \"Arc","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:207bf074023f26fb93eb2d2ac33b8fb28e9a595becb42239d265d12e92b050d5","observation_id":"a78a809a-189f-493a-b876-786a32e3b745","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"The camera zooms in optically without moving through space,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:13dd0d5192c20b62ad7a44858ee4a924d385c97552972b6474d96cdfded65d1b","observation_id":"6aa32363-3d2e-45f2-b30d-2913db8a9a00","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:3396e09c144d67b3c727d65fbca6073d4024fafe06dddbdc5bc7d48a4d6bb6a1","observation_id":"4e934a7c-21a7-45d8-ac2f-1af81d9ca5ef","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:a9815cdfe76e4abc39d6e4279935f8e907bd55d044e718342e1f7c88bba3dfae","observation_id":"72c4e0e2-05dc-4903-9bd8-8ae07ff31995","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:9d52227ea8b905d24e9beb771156461636449a924d0f30e0b1e3b4c0863aec60","observation_id":"8c51f8ad-2bf0-4785-87e5-d5b273a85bca","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:1409fbf967c0c9a589d11e3fa1c437732426eaf4f911d68683d2f5c0edd52b92","observation_id":"4538cdf5-0c7d-4648-82e4-fb445f1304ac","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:92460b69a5751275850151eeab2f34ae548cf2804a5fdae41a9eca46299f8d73","observation_id":"e8305792-42b7-4557-85d6-1e6984b727c8","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:f886a64c40e70f196c185a763c3746e27de1b31ff441d6c9f24dca90ae00a07e","observation_id":"7e5cfc1a-67cd-4b18-8c08-e80f96b84058","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"subject\":","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:042911b3f56d40d5e6e3c954717ee91e0617c337c111da8a1e9876fbfecbf9ec","observation_id":"0c90a6d8-1042-4887-8085-1c7713caa7e9","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T12:44:29.845003Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":69,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 0 inbound Pith citation observations for arXiv:2607.03043."}