{"as_of":"2026-08-09T15:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0184ff2d710cda5f0da22c63652dc0db22711f9deafabb3eb2c2490bc09265ac","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:32:13.889873Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.24346/citation-record","integrity":"/paper/2505.24346/integrity","json":"/paper/2505.24346/citation-record.json","paper":"/paper/2505.24346"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:18.852786Z","title":"Mm-vit: Multi-modal video transformer for compressed video action recognition","venue":null,"work_id":"55d49773-ee4f-495c-9bc8-2f03671aabd2","year":1910},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.169622Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:e1b9e770e7b43193a345c0dacadc18995b6b9c9a207525f737f4e472ca1c5b24","observation_id":"2ac25e71-3ae8-449b-9bd8-4267519269bd","resolution":{"observed_at":"2026-08-07T12:32:18.898598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:18.654406Z","title":"Mar: Masked autoencoders for efficient action recognition.IEEE Transactions on Multimedia, 26:218–233, 2023","venue":null,"work_id":"bf011c19-5f6f-4ff3-adae-82e3dedda10b","year":2023},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.271553Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:7e0dbe1d40dd9892f62f9dca471bcb7be09b5630dbef9d350f5be3797db84592","observation_id":"408e9a2d-3b76-43e1-8d19-c0db8a1f8b40","resolution":{"observed_at":"2026-08-07T12:32:18.765665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:18.483189Z","title":"Mnv3-mfae: A lightweight network for video action recognition.Electronics, 14(5):981, 2025","venue":null,"work_id":"e42de914-2730-49a0-ad14-ebcf8f29e5ca","year":2025},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.342343Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:3ba60f11e2eb7abf5e05f85f493327275f7bbc28b60b279fa82238dd33bacf7d","observation_id":"d3ca7c93-d783-4fc9-8c8f-d91f16364647","resolution":{"observed_at":"2026-08-07T12:32:18.544716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:18.189110Z","title":"Swinbert: End-to-end transformers with sparse attention for video captioning","venue":null,"work_id":"988d95b5-756c-46b6-815c-7d0425d31ef4","year":2022},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.421238Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:23c5d869325bd36c2c595a20c610149f6fb67802b3766eb41de8455e8b666d40","observation_id":"0f4a7285-0452-42b3-a448-a88371dc3454","resolution":{"observed_at":"2026-08-07T12:32:18.266711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:18.090785Z","title":"End-to-end generative pretraining for multimodal video captioning","venue":null,"work_id":"6fa070e7-a7bc-4342-b605-39b50d9413ae","year":2022},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.512771Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:128fd38437b67151bc6629519a5ef11b7a737fe3c06312d11b320925f02ffece","observation_id":"d18ed918-683d-4e62-9802-8732f95e455e","resolution":{"observed_at":"2026-08-07T12:32:18.135728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:17.857947Z","title":"Text with knowledge graph augmented transformer for video captioning","venue":null,"work_id":"e3376dbb-20e1-4b37-8a3d-fc69c936c8c3","year":2023},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.605822Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:061e8a01e746c85967fa8934f06eac21dfe0d44fbe147c018d3f556a7bc4918a","observation_id":"2dd63dcc-8a37-4eba-92da-5b710be2637a","resolution":{"observed_at":"2026-08-07T12:32:17.924672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:17.678157Z","title":"Automatic video captioning using tree hierarchical deep convolutional neural network and asrnn-bi-directional lstm.Computing, 106(11):3691–3709, 2024","venue":null,"work_id":"fd674b0f-857c-4c51-b4f9-f3210ccf370f","year":2024},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.711402Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:ff0832a285d8cd2d5368b79684f1c027b7591a4a13a3a42a48eee7355b2b545e","observation_id":"3c44d19c-02c3-41b2-b73a-b3873a620ef5","resolution":{"observed_at":"2026-08-07T12:32:17.778516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:17.363655Z","title":"Invariant grounding for video question answering","venue":null,"work_id":"44132945-d375-4fac-bf7d-972db95c8b87","year":2022},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.807715Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:3ab33e62b3b50206eefc728c4889faf137c6441ab0bbe0ee54ff48e41c949c80","observation_id":"da4843da-867d-484e-a70b-f61e44a77040","resolution":{"observed_at":"2026-08-07T12:32:17.551486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:17.084925Z","title":"From representation to reasoning: Towards both evidence and commonsense reasoning for video question-answering","venue":null,"work_id":"6d293307-fda7-4829-99a1-29c254849524","year":2022},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.885422Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:5e929c893f25645f9e3c74a830792bd076d4c6957e2bbe9aa2f071270737cf67","observation_id":"a94c8fd1-48a4-4d3b-b56e-525276fc14cb","resolution":{"observed_at":"2026-08-07T12:32:17.195284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:09.991658Z","title":"Morevqa: Exploring modular reasoning models for video question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.991658Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:e2eadc2b93d34013d146fd9949b11f6fa0b0e97d5fbeb0b5d7b9045833d57fa3","observation_id":"39c95ccd-7480-4c1c-947a-a64ad30d46af","resolution":{"observed_at":"2026-08-07T12:32:09.991658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:16.852885Z","title":"Diversifying spatial-temporal perception for video domain generalization.Advances in Neural Information Processing Systems, 36:56012–56026, 2023","venue":null,"work_id":"8797decc-c5a5-40fd-bedf-55da7178380f","year":2023},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:10.103329Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:2f8bd3b32c92362f1baf319bfc471900247f0081a6ce7a225f93d321624083b0","observation_id":"719fcd8c-da12-49b7-952c-787b07e52646","resolution":{"observed_at":"2026-08-07T12:32:16.929225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:10.172317Z","title":"A multi-modal egocentric activity recognition approach towards video domain generalization.Sensors, 24(8):2491, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:10.172317Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:41cb4797bd02776420ab8bf1de81f4b4c059ee77b92e22dff6afdaf6b39ef238","observation_id":"c6ae223e-649a-476b-b129-640cd0b54210","resolution":{"observed_at":"2026-08-07T12:32:10.172317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:16.691318Z","title":"Meta-causal learning for single domain generalization","venue":null,"work_id":"a723ecdb-e179-4e4b-b1f4-a61b2cc1690c","year":2023},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:10.246214Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:268857d8c0dbaaae661c3845255e623ba1254c84b73967e54055481c17e2ef2e","observation_id":"9aa4dada-0a55-4abf-a65a-93b597e49f3f","resolution":{"observed_at":"2026-08-07T12:32:16.764934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:16.613184Z","title":"Tgif-qa: Toward spatio-temporal reasoning in visual question answering","venue":null,"work_id":"7ca1a6cd-43ed-4c6b-85f4-de1e5014df6d","year":2017},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:10.308652Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:5adf23247c8918400ba14fb96db2a4ba34079ae5db04842b4e55ec35683567d4","observation_id":"5de17fab-d8c3-44db-9614-aade6df7d16b","resolution":{"observed_at":"2026-08-07T12:32:16.645225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:10.406120Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:10.406120Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:8e453ae572eb401a821f33cd25e134a281c86b6030d1f29008677daa595813d4","observation_id":"3642f322-b4d7-420c-99d3-6c0c4b4e89ee","resolution":{"observed_at":"2026-08-07T12:32:10.406120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11303","last_updated":"2024-06-17T08:09:00Z","snapshot_observed_at":"2026-08-04T15:53:11.168523Z","submitted_at":"2024-06-17T08:09:00Z","title":"VideoVista: A Versatile Benchmark for Video Understanding and Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11303","snapshot_observed_at":"2026-08-07T12:32:10.535033Z","title":"Videovista: A versatile benchmark for video understanding and reasoning.arXiv preprint arXiv:2406.11303, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:10.535033Z"},"links":{"cited_paper":"/paper/2406.11303","citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:28a5b3b174e37db7e2a0d7c71ce3b0769c0e11ffa17211d75dff5ee859216fbb","observation_id":"408e7f61-f69b-46cd-97ec-da0311486d57","resolution":{"observed_at":"2026-08-07T12:32:10.535033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T12:32:10.659981Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.arXiv preprint arXiv:2405.21075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:10.659981Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:5d74643d2915d607acbaec977eb875c1cafc718b452ddb2dd5f78f6022cbc5d5","observation_id":"4d7565d3-43ba-40ea-bf00-649e69218ad5","resolution":{"observed_at":"2026-08-07T12:32:10.659981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:16.477984Z","title":"Vatex: A large-scale, high-quality multilingual dataset for video-and-language research","venue":null,"work_id":"87afed00-00f1-461e-8d41-f2e3c9e85ad8","year":2019},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:10.737475Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:3462cb2ba72f6ddb2c52eea005f088381ab4f9817405d36f2bec8a5f61d2bc87","observation_id":"04193e7e-8181-459f-9af9-e29e13903829","resolution":{"observed_at":"2026-08-07T12:32:16.532575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11347","last_updated":"2024-09-17T01:30:36Z","snapshot_observed_at":"2026-08-06T19:47:06.400640Z","submitted_at":"2024-08-21T05:27:55Z","title":"Multimodal Datasets and Benchmarks for Reasoning about Dynamic Spatio-Temporality in Everyday Environments","version":2},"cited_work":{"arxiv_id":"2408.11347","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.11347","snapshot_observed_at":"2026-08-07T12:32:14.215450Z","title":"Multimodal Datasets and Benchmarks for Reasoning about Dynamic Spatio-Temporality in Everyday Environments","venue":"cs.AI","work_id":"eb7cb6ec-9254-4b7d-9399-860db0a904ba","year":2024},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:10.839221Z"},"links":{"cited_paper":"/paper/2408.11347","citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:375f35d989926d90fa291e733e7de928ed1b0952fc47aa50fe3f1d6d1445a77e","observation_id":"bfef86a0-5c3d-43d5-acfa-ccba42c555b1","resolution":{"observed_at":"2026-08-07T12:32:14.306658Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:16.346484Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":"894cc25c-c2bf-4799-8714-8edb57f3b43d","year":2024},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:10.912842Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:95258855cb2ad246392ee61b909ece96d8f7ba0562fa83df7e72dcf287ff7304","observation_id":"f001e191-3bef-465f-873e-5f0544e86273","resolution":{"observed_at":"2026-08-07T12:32:16.400235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:11.012551Z","title":"Sharegpt4video: Improving video understanding and generation with better captions.Advances in Neural Information Processing Systems, 37:19472– 19495, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:11.012551Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:389ab729320cca974473be2dd0077b37bbe17ee309904902898bba1c5f94b239","observation_id":"ca3c054d-30ba-46a5-a16e-d55863fa1781","resolution":{"observed_at":"2026-08-07T12:32:11.012551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T12:32:11.135409Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:11.135409Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:f936863b913f26601cde143403a36f0d04491a71a8ebd24e9b79a7a4dcfebe41","observation_id":"aa8fcc48-396c-45eb-8395-952d6e62d9e5","resolution":{"observed_at":"2026-08-07T12:32:11.135409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:11.277723Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:11.277723Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:a5acdd2f9b500304e8a1138ae7961868bed40a0b2c143dca40a4b9d7d2777f40","observation_id":"47e1aad9-c1a1-46fb-9736-104483cb5b61","resolution":{"observed_at":"2026-08-07T12:32:11.277723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-07T12:32:11.404740Z","title":"The kinetics human action video dataset.arXiv preprint arXiv:1705.06950, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:11.404740Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:1ad6d821d7657d5bea50e078ba20bfd6d383da244e7cdaabd088a2bb8771d6a4","observation_id":"0f30c54c-a707-413a-acfd-957ef53fdc5a","resolution":{"observed_at":"2026-08-07T12:32:11.404740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:11.537568Z","title":"Hollywood in homes: Crowdsourcing data collection for activity understanding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:11.537568Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:3cd93c3c4f4ea8de05b31aaec9a17affecfd62b2dfe027a43591aab386aa1fc0","observation_id":"12e75b38-7b5e-4f43-91bf-3494471c519f","resolution":{"observed_at":"2026-08-07T12:32:11.537568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.01696","last_updated":"2019-05-07T21:34:05Z","snapshot_observed_at":"2026-07-06T06:59:26.080263Z","submitted_at":"2018-09-05T19:14:11Z","title":"TVQA: Localized, Compositional Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.01696","snapshot_observed_at":"2026-08-07T12:32:11.633968Z","title":"Tvqa: Localized, compositional video question answering.arXiv preprint arXiv:1809.01696, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:11.633968Z"},"links":{"cited_paper":"/paper/1809.01696","citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:ab93630eaf8afc5e39c0c44b23c369172219f36613fb0fb86688c84280c35de2","observation_id":"3daff457-2f87-4fc7-b2e4-9a7c19385452","resolution":{"observed_at":"2026-08-07T12:32:11.633968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:11.713809Z","title":"Video question answering via gradually refined attention over appearance and motion","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:11.713809Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:84449368cb7fca353302cede7b6a553fc4833740680d91d477fe536b3e1271e2","observation_id":"3abd516f-781c-4d5d-bd2e-5341b2b2387d","resolution":{"observed_at":"2026-08-07T12:32:11.713809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:11.808333Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:11.808333Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:05aeba093c4e002825dcf89c558cbff237f115ebfa794b9af879841fd29b5fba","observation_id":"fe10182d-2607-4e6b-a8cc-aa468c18279e","resolution":{"observed_at":"2026-08-07T12:32:11.808333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:16.135278Z","title":"Domain generalization for video anomaly detection considering diverse anomaly types.Signal, Image and Video Processing, 18(4):3691–3704, 2024","venue":null,"work_id":"2d78d667-42e7-43fc-8a01-4078cce31bc0","year":2024},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:11.907963Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:27e923e1dab01144e5b05a8a3de1d2a1bc5d56abe1ec8ed4e7d7ba0366968e03","observation_id":"a479c01a-fbd6-4be4-90ed-34515963f71f","resolution":{"observed_at":"2026-08-07T12:32:16.181783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:16.031328Z","title":"Video-audio domain generalization via confounder disentanglement","venue":null,"work_id":"98e7be0b-7043-4e86-93c4-37414a0ccd18","year":2023},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:11.958263Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:0266862021fb170fc20511684ec6a6b694361778abafc9758a981dfbb1f05559","observation_id":"afd06ccc-503f-4e77-90a8-fad64cd4d8f5","resolution":{"observed_at":"2026-08-07T12:32:16.076518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:15.876546Z","title":"Videodg: General- izing temporal relations in videos to novel domains.IEEE Transactions on Pattern Analysis and Machine Intelligence, 44(11):7989–8004, 2021","venue":null,"work_id":"36590349-21a9-4d44-8219-e10bf904f2c0","year":2021},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:12.051541Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:458c83edc44f63cdfdb67a29bd06d6e2ae57e6aabc9f2213c3298f7df1b20dc4","observation_id":"e8ae2171-134a-421e-a12a-96bcb2751ee4","resolution":{"observed_at":"2026-08-07T12:32:15.938790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:15.773311Z","title":"Ani-gifs: A benchmark dataset for domain generalization of action recognition from gifs.Frontiers in Computer Science, 4:876846, 2022","venue":null,"work_id":"0c2176ff-626c-446e-84a6-134b771a197d","year":2022},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:12.169976Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:8e92d0b9c098fbdb518b4b6a91bac0923009632fdb9730df5d9b6bf0308de41e","observation_id":"83944137-ba67-43fa-80a5-680fe3cc3151","resolution":{"observed_at":"2026-08-07T12:32:15.819775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:15.667338Z","title":"What can a cook in italy teach a mechanic in india? action recognition generalisation over scenarios and locations","venue":null,"work_id":"14e9a3f1-478d-45a0-9d1f-c5899d0e6b3d","year":2023},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:12.279011Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:178725977bf50056c4b94c252b5955d3f68a52b1a5f89a7a87d02ee46137a0b0","observation_id":"88bec4d3-31fa-4d79-bf07-42b717047a3a","resolution":{"observed_at":"2026-08-07T12:32:15.731642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:12.349303Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:12.349303Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:2244a9ec5366445eebb474c448bf4e53087550ef59a771bdafa6602830f10a1e","observation_id":"3173452b-aaee-44b7-8dec-102394f24a74","resolution":{"observed_at":"2026-08-07T12:32:12.349303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:15.535296Z","title":"Multimodal motion conditioned diffusion model for skeleton- based video anomaly detection","venue":null,"work_id":"d39eeafa-5f23-4136-a7c9-e5d0cc07b399","year":2023},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:12.469345Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:82bc314844dfc0c417f7313a7aea084206d5d2af4ffd12d8fe9a838f8fe8f970","observation_id":"50943904-c01d-455a-9c31-7a1f84084fe4","resolution":{"observed_at":"2026-08-07T12:32:15.579291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:12.589851Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:12.589851Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:e1cd29b789ad71bb120557bff28239c7f3e44674272a4b0b451693bd57276f9c","observation_id":"ea7fe981-ba3d-46fc-b507-43ec8e51e7b8","resolution":{"observed_at":"2026-08-07T12:32:12.589851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:12.660743Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding.Advances in Neural Information Processing Systems, 36:46212–46244, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:12.660743Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:147637cc1cc1bff3eec3d1ffa922c90f2b0eaa25df5c6ba044daabd5923106d0","observation_id":"1acd7fa0-0319-4d83-a723-8ff7b95ac313","resolution":{"observed_at":"2026-08-07T12:32:12.660743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16103","last_updated":"2023-11-28T18:16:29Z","snapshot_observed_at":"2026-08-05T15:15:57.768787Z","submitted_at":"2023-11-27T18:59:58Z","title":"Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16103","snapshot_observed_at":"2026-08-07T12:32:12.770007Z","title":"Video-bench: A comprehensive benchmark and toolkit for evaluating video-based large language models.arXiv preprint arXiv:2311.16103, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:12.770007Z"},"links":{"cited_paper":"/paper/2311.16103","citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:873a0e8347389010f0f1e9deadcbf51c8df2305b08cf2a4be4718fbd07de2c9e","observation_id":"dec74c2f-daa6-4af3-993d-154d4e839773","resolution":{"observed_at":"2026-08-07T12:32:12.770007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-04T21:17:37.211833Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-07T12:32:12.883906Z","title":"Tempcompass: Do video llms really understand videos?arXiv preprint arXiv:2403.00476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:12.883906Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:43a18df82ce02f3fa1ae1af65dbcd6b2a2ff160f93c89b9f0b662aee9244ed1e","observation_id":"57437514-aca4-4203-9fdb-6bd9ed8012ea","resolution":{"observed_at":"2026-08-07T12:32:12.883906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:12.990057Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:12.990057Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:03350ea1417d3cade55cbfd3d1bbe82f7ceacda2b46381cf5ff630660f572002","observation_id":"e93b29a3-6889-478a-9775-24288b4fe2fe","resolution":{"observed_at":"2026-08-07T12:32:12.990057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:15.376402Z","title":"Poem: polarization of embeddings for domain-invariant representations","venue":null,"work_id":"221f55d6-26bd-40af-908f-a0b6bb31318c","year":2023},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:13.106658Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:229da78ceae988e6ca42ad74ce836accc5f23fd25a5e89209be27c70db9e56c7","observation_id":"b0e01d63-607a-4dd7-86f7-e68e3e54acb9","resolution":{"observed_at":"2026-08-07T12:32:15.456435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:15.209960Z","title":"Video-text as game players: Hierarchical banzhaf interaction for cross-modal representation learning","venue":null,"work_id":"13137c2e-5d19-4ca2-b5ba-8fba3bb18c26","year":2023},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:13.180703Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:c13824a519a4aba35c76c6e97fb00e376b2a4978826ab5261509b866be68ba7a","observation_id":"de7d5e04-b281-46b1-8e1c-6643da3feda6","resolution":{"observed_at":"2026-08-07T12:32:15.297134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:15.040434Z","title":"Clifton, and Jie Chen","venue":null,"work_id":"592c2e4a-3ab5-4c8e-aa82-3adceeac82bc","year":2022},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:13.233194Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:92d33bb990cbd283d478b42d81b5b068b4e06fa7d1eff9452c1cd5007e1f7a55","observation_id":"f3122d34-d08f-4471-b2fb-b56761562758","resolution":{"observed_at":"2026-08-07T12:32:15.126826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T12:32:13.326003Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms.arXiv preprint arXiv:2406.07476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:13.326003Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:35c41cb6e0f5d35d0be231847436b23b057cb5247b17c664e85632627393bff5","observation_id":"88d004b5-88ee-426f-90fa-505684e4b023","resolution":{"observed_at":"2026-08-07T12:32:13.326003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03413","last_updated":"2024-04-04T12:46:01Z","snapshot_observed_at":"2026-08-09T11:58:18.895378Z","submitted_at":"2024-04-04T12:46:01Z","title":"MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03413","snapshot_observed_at":"2026-08-07T12:32:13.398642Z","title":"Minigpt4-video: Advancing multimodal llms for video understanding with interleaved visual-textual tokens.arXiv preprint arXiv:2404.03413, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:13.398642Z"},"links":{"cited_paper":"/paper/2404.03413","citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:4bf631cb25e169cdffa802bea8a2a4d6fcf8b3aac034de62ba8ac7597a1e9e45","observation_id":"b324e589-68a1-4714-8d08-3deb4559a04d","resolution":{"observed_at":"2026-08-07T12:32:13.398642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T12:32:13.451229Z","title":"Videochat: Chat-centric video understanding.arXiv preprint arXiv:2305.06355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:13.451229Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:e3b8b331ed9dcd714c74d7f3a4a254bb7d08441b7374dfea5fbe5d354f5610a9","observation_id":"7ddc9ed9-fd2d-4530-ba5f-289c8eae72c8","resolution":{"observed_at":"2026-08-07T12:32:13.451229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T12:32:13.505372Z","title":"Video-llava: Learning united visual representation by alignment before projection.arXiv preprint arXiv:2311.10122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:13.505372Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:e755d4e7b0871f8dc1511978742fa171d97632893f19bd538384eb4546973cbd","observation_id":"52315005-d983-45bb-afc4-a0374560c0ed","resolution":{"observed_at":"2026-08-07T12:32:13.505372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:14.866568Z","title":"mPLUG-owl3: Towards long image-sequence understanding in multi-modal large language models","venue":null,"work_id":"f67c35a3-c124-4331-9b4e-d17710e43bea","year":2025},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:13.548397Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:8d666f598fa7b471fbe82d175d3092a775ffc26f64f19ecde184c82684e5d0a4","observation_id":"f53ff2bb-efdb-4858-b175-7b01a95b1168","resolution":{"observed_at":"2026-08-07T12:32:14.916081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:14.649175Z","title":"Video-ccam: Enhancing video-language understanding with causal cross-attention masks for short and long videos, 2024","venue":null,"work_id":"e16c56d5-2b04-4c33-8bc3-7b2664689ba0","year":2024},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:13.607365Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:fa168aee0212da78a513d1decda064559f320368f6c21b51a34a9b242cb87488","observation_id":"56e612ab-1b36-4961-b76d-e4097da982a5","resolution":{"observed_at":"2026-08-07T12:32:14.721883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:13.692363Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:13.692363Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:16250e4a2451ad89582e80883adeb7411d165e38c53fbbecd2e18a606a89a83a","observation_id":"e5057a45-94c8-41c0-9308-1e4fcef91d8a","resolution":{"observed_at":"2026-08-07T12:32:13.692363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:13.775272Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:13.775272Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:c9cbadc5be5ba48c5be469675277b4402fb6ad8ebeff081b0b6ca0e1950c87a0","observation_id":"1cd6c106-ca4c-4be1-9780-1baf1543045a","resolution":{"observed_at":"2026-08-07T12:32:13.775272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:13.822308Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:13.822308Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:f39b64dea7f77f84e5c98273fa077935a4c04b057b9c90ec6b9f1a1bbde2c4c1","observation_id":"40ee116f-83bc-4a1e-8d60-984fb2908a3f","resolution":{"observed_at":"2026-08-07T12:32:13.822308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:14.462307Z","title":"C- pack: Packed resources for general chinese embeddings","venue":null,"work_id":"162fc6d9-c044-489c-b447-d62baf6e3140","year":2024},"citing_paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:13.889873Z"},"links":{"citing_paper":"/paper/2505.24346"},"observation_digest":"sha256:1329cca01da6f529c8c5050ba8343986e220908617e038792a6c791a49f73c52","observation_id":"b7f291b6-cb27-4868-aac0-081effaf01d9","resolution":{"observed_at":"2026-08-07T12:32:14.508279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24346","last_updated":"2025-05-30T08:39:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T11:59:19.522063Z","submitted_at":"2025-05-30T08:39:36Z","title":"VUDG: A Dataset for Video Understanding Domain Generalization"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":26},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2505.24346."}