{"as_of":"2026-08-07T10:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2cc55d58dfbcd972c7985fb6bc0c3abfac3ea1b36333d2a467032fee0b0aadc6","coverage":[{"denominator":103,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T02:44:52.920816Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T10:38:22.619277Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-02T20:57:23.153286Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"cited_work":{"arxiv_id":"2604.19193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.19193","snapshot_observed_at":"2026-07-02T20:57:23.153286Z","title":"How Far Are Video Models from True Multimodal Reasoning?","venue":"cs.CV","work_id":"c3ac5465-7bcb-45d5-bf3f-ae38c0075362","year":2026},"citing_paper":{"arxiv_id":"2606.02564","last_updated":"2026-06-27T07:03:15Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-06-01T17:54:26Z","title":"VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T15:26:21.284810Z"},"links":{"cited_paper":"/paper/2604.19193","citing_paper":"/paper/2606.02564"},"observation_digest":"sha256:ab0b551109a377c31a9d6d1d5e7b2586dfd22b728abcdf136bf414d875abd83f","observation_id":"f7379099-2bc2-4004-882f-8a29378c8449","resolution":{"observed_at":"2026-07-01T22:26:17.309495Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"cited_work":{"arxiv_id":"2604.19193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.19193","snapshot_observed_at":"2026-07-02T20:57:23.153286Z","title":"How Far Are Video Models from True Multimodal Reasoning?","venue":"cs.CV","work_id":"c3ac5465-7bcb-45d5-bf3f-ae38c0075362","year":2026},"citing_paper":{"arxiv_id":"2606.02564","last_updated":"2026-06-27T07:03:15Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-06-01T17:54:26Z","title":"VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T10:38:22.619277Z"},"links":{"cited_paper":"/paper/2604.19193","citing_paper":"/paper/2606.02564"},"observation_digest":"sha256:92f58bf4c583d5b29bfc1d7de670c2aa4f9e7e4154c7b2bdd51d2b416707292b","observation_id":"856341ca-efa8-4bab-a6bb-7b1eeec1c6ec","resolution":{"observed_at":"2026-06-30T10:44:36.838077Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"cited_work":{"arxiv_id":"2604.19193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.19193","snapshot_observed_at":"2026-07-02T20:57:23.153286Z","title":"How Far Are Video Models from True Multimodal Reasoning?","venue":"cs.CV","work_id":"c3ac5465-7bcb-45d5-bf3f-ae38c0075362","year":2026},"citing_paper":{"arxiv_id":"2606.08091","last_updated":"2026-06-06T10:35:28Z","snapshot_observed_at":"2026-07-06T23:47:38.671681Z","submitted_at":"2026-06-06T10:35:28Z","title":"VideoWeaver: Evaluating and Evolving Skills for Agentic Long Video Generation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-27T20:04:10.711238Z"},"links":{"cited_paper":"/paper/2604.19193","citing_paper":"/paper/2606.08091"},"observation_digest":"sha256:dd1cc74ec96c6a64e26f883c79733e7d16192ea4eaf213c7f80b65fd57891c1b","observation_id":"93c4d9c3-d5fb-4301-94ac-3f3d8c06a502","resolution":{"observed_at":"2026-07-02T20:57:23.154343Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.19193/citation-record","integrity":"/paper/2604.19193/integrity","json":"/paper/2604.19193/citation-record.json","paper":"/paper/2604.19193"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.19457","last_updated":"2026-02-14T11:42:30Z","snapshot_observed_at":"2026-08-06T03:52:41.836315Z","submitted_at":"2025-07-25T17:42:32Z","title":"GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2507.19457","doi":"10.48550/arxiv.2507.19457","metadata_source":"pith","pith_arxiv_id":"2507.19457","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning","venue":"cs.CL","work_id":"40b60d06-dc1c-4799-b75d-ff1eca653049","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2507.19457","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:40afdc99ba563c4d05267c85faddbb447a4239143781ae7e3084ab192264f226","observation_id":"6e4d32ba-24bc-45bd-934e-607289e37cb2","resolution":{"observed_at":"2026-05-12T07:26:20.435474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:19.13226+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:19.13226+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Oxford University Press (1984) 6","venue":null,"work_id":"0359ca9c-6a9c-49c7-9b25-ad2a709eb341","year":1984},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:4c31e093f31f42b4cf2572c02b02ac6c621103d366558a1ee73616f23ac5fb00","observation_id":"deaab920-39a6-4d1a-baee-42e2dafd5374","resolution":{"observed_at":"2026-05-22T19:45:04.757394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03520","last_updated":"2024-10-03T17:24:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T17:53:55Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","version":2},"cited_work":{"arxiv_id":"2406.03520","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.03520","snapshot_observed_at":"2026-07-07T15:43:53.689981Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","venue":"cs.CV","work_id":"27ed795c-abbe-4de1-9a7a-2ecf39c354f3","year":2024},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2406.03520","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:97e50522c6c3ea1f11b698baf3fffd7753b1b687028c5c3993718c81dfbe0179","observation_id":"0e09d2cf-76c8-41de-a044-490ba13a73aa","resolution":{"observed_at":"2026-05-20T11:34:37.994076Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06800","last_updated":"2025-03-09T22:49:12Z","snapshot_observed_at":"2026-08-04T19:41:18.206234Z","submitted_at":"2025-03-09T22:49:12Z","title":"VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation","version":1},"cited_work":{"arxiv_id":"2503.06800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.06800","snapshot_observed_at":"2026-07-04T13:19:51.020711Z","title":"Videophy-2: A challenging action-centric physical commonsense evaluation in video generation","venue":null,"work_id":"4dfe3980-dfd5-4917-95e9-179c29e4eb18","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2503.06800","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:96309885cf982fe08837a83fdf29288e2235f773d68ad3076ebf0270326ad0e1","observation_id":"9864ebcd-f30e-4cc2-9c58-0e545b7f4650","resolution":{"observed_at":"2026-05-11T12:51:03.643358Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"056c85b2-c274-4c5f-ab70-f8ef335f814c","year":2008},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:1420fbfcb056afd276d0ac8511744b5ede14e927d2266931cc7f7f0c4f7b8143","observation_id":"ec496d56-a06b-4ec3-840b-117c60f06c02","resolution":{"observed_at":"2026-05-22T19:45:04.755695Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:41:42.003680Z","title":"Advances in neural information processing systems33, 1877–1901 (2020) 1","venue":null,"work_id":"c7b46ebd-4408-4857-b1d2-b67fb0aaa784","year":1901},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:996f8826e6632263fbfc7300807816d0dd1db59ce7d4c15e4e872b857c2a79e5","observation_id":"3d42086c-960a-483a-9a37-1dccf399e2d2","resolution":{"observed_at":"2026-05-22T19:45:04.851393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2015) 4","venue":null,"work_id":"9e68fd13-9c80-437e-97b7-c629e3c0f6dd","year":2015},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:205d6ce042bd12b0f14c80963edb441f3a2a694bab5ae64e60268aa2382e033a","observation_id":"4ce4eb6d-a50e-488d-8029-e814b9663fc4","resolution":{"observed_at":"2026-05-22T19:45:04.848543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.08191","doi":"10.48550/arxiv.2510.08191","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training-free group relative policy optimization, October 2025","venue":"ArXiv.org","work_id":"e147d6d6-f3f4-44ff-94e9-78f84be63bdb","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:5fac66cb9288932f928a50d50fca4c5292eaff465c1a4dfd8a795730827be35c","observation_id":"f8520187-7f24-407e-9afb-5b38b685c028","resolution":{"observed_at":"2026-05-11T12:51:04.145213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14294","last_updated":"2021-05-24T17:49:18Z","snapshot_observed_at":"2026-08-04T11:32:10.695202Z","submitted_at":"2021-04-29T12:28:51Z","title":"Emerging Properties in Self-Supervised Vision Transformers","version":2},"cited_work":{"arxiv_id":"2104.14294","doi":"10.48550/arxiv.2104.14294","metadata_source":"pith","pith_arxiv_id":"2104.14294","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Emerging Properties in Self-Supervised Vision Transformers","venue":"cs.CV","work_id":"6b124bd1-c9f1-4251-96c1-2683f7f17a64","year":2021},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2104.14294","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:aa44a30d6fcbe5655b0ed76614d7fb2423f7ef4d215b9aceffb197ac7b17fa4f","observation_id":"7b9ddc2a-5337-4393-a4c5-beb2b6385b24","resolution":{"observed_at":"2026-05-16T14:04:51.784333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T20:52:03.251463+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T20:52:03.251463+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":"2501.17811","doi":"10.48550/arxiv.2501.17811","metadata_source":"pith","pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","venue":"cs.AI","work_id":"67d9e391-26d1-459e-ab56-07e60511c886","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:68cf5927b45ede21218fea2bf26dea6d2dc242f352b0aae73a4ac02bafb2d992","observation_id":"b591f5e2-e6ce-48ce-ad74-ac81762f24d8","resolution":{"observed_at":"2026-05-11T12:51:04.015545Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":"2505.14683","doi":"10.48550/arxiv.2505.14683","metadata_source":"pith","pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emerging Properties in Unified Multimodal Pretraining","venue":"cs.CV","work_id":"e0cfd82c-f5d4-44fd-b531-ec73ab0a805b","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:d5bc6082a4ee347504dc179343e826811e485fb4b9c2ff407587b042ededb6d8","observation_id":"d1822d7c-af3c-46ce-9b39-9104241dc763","resolution":{"observed_at":"2026-05-11T12:51:04.132440Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE international conference on computer vision","venue":null,"work_id":"d544ed63-35e4-4dd8-b8e2-b5298c247e5a","year":2015},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:ddfe5c1d11de86b0d1fe2107115947bef556eb40ad67a25db48524969ec1b7e7","observation_id":"e99af556-8697-44f9-9c12-c6262988f3fb","resolution":{"observed_at":"2026-05-22T19:45:04.834545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":"2312.09244","doi":"10.48550/arxiv.2312.09244","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Fisch, A., Heller, K., Pfohl, S., Ramachandran, D., Shaw, P., and Berant, J","venue":"arXiv (Cornell University)","work_id":"0d3df61b-eeb7-4a01-98a5-de379e1ac583","year":2024},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:3b366250b9e4f001f340572168c92b6523a74f31d25d4fd1ac0a9ecb25a55b68","observation_id":"c2445045-e6d9-4182-b38a-59f9449287e6","resolution":{"observed_at":"2026-05-11T12:51:04.216352Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17453","last_updated":"2024-10-31T23:23:22Z","snapshot_observed_at":"2026-07-06T18:51:23.832577Z","submitted_at":"2024-07-24T17:37:05Z","title":"VILA$^2$: VILA Augmented VILA","version":2},"cited_work":{"arxiv_id":"2407.17453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.17453","snapshot_observed_at":"2026-07-02T11:46:55.437498Z","title":"VILA2: VILA Augmented VILA","venue":null,"work_id":"cda20748-41d3-4441-bd08-7b1038d3a0c0","year":2024},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2407.17453","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:3f96916c60486e49ecba08d03dd624219c6aced795669bdd763f66a7528ba1f5","observation_id":"973a294d-f044-40c4-a8dd-3fa76d11c722","resolution":{"observed_at":"2026-05-11T12:51:04.007239Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a58f9118-7b43-4555-86ab-17fbf00915cb","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:d1fb1a15751c415e36e53bd21d4995f948389c71ba7b4ed6113b2b945f9d4eec","observation_id":"fb159a9e-4f83-41e7-80b6-8c522d38ac45","resolution":{"observed_at":"2026-05-22T19:45:04.832892Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dd846982-1279-44a0-8282-0b206f1f2ce1","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:7f9cd610d3c06731f115557b7e98bc79f57b7775b1111e60b2141138c518c2fe","observation_id":"b8fc3120-7dfe-4d30-9945-c2666a8df059","resolution":{"observed_at":"2026-05-22T19:45:04.760815Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16770","last_updated":"2025-05-23T15:40:22Z","snapshot_observed_at":"2026-07-06T21:28:33.821060Z","submitted_at":"2025-05-22T15:11:57Z","title":"RBench-V: A Primary Assessment for Visual Reasoning Models with Multi-modal Outputs","version":2},"cited_work":{"arxiv_id":"2505.16770","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16770","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rbench-v: A primary assess- ment for visual reasoning models with multi-modal outputs","venue":null,"work_id":"0748c18f-3ac0-426c-9a52-1a0542a2d72b","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2505.16770","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:12d7cf19bd54fde095d506eb7fd69eb4119379dcf8d2d1af6069bc2d158bb376","observation_id":"5cd44c22-9197-40fc-b21d-a9360fd3201a","resolution":{"observed_at":"2026-05-11T12:51:03.698359Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03233","last_updated":"2026-01-06T18:24:41Z","snapshot_observed_at":"2026-07-06T22:40:51.136169Z","submitted_at":"2026-01-06T18:24:41Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","version":1},"cited_work":{"arxiv_id":"2601.03233","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.03233","snapshot_observed_at":"2026-07-10T01:46:41.047035Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","venue":"cs.CV","work_id":"1334671f-ee98-4c53-a1d4-0805281f8d2b","year":2026},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2601.03233","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:687c489483f311aa7904342ad2a8d00e235e20b21eb71e276b397457961e5492","observation_id":"e4c9c31a-6721-4d31-9c71-30050e497e9c","resolution":{"observed_at":"2026-05-11T12:51:04.198821Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04907","last_updated":"2025-04-29T15:56:46Z","snapshot_observed_at":"2026-08-03T08:16:16.615454Z","submitted_at":"2025-04-07T10:32:42Z","title":"Video-Bench: Human-Aligned Video Generation Benchmark","version":2},"cited_work":{"arxiv_id":"2504.04907","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.04907","snapshot_observed_at":"2026-07-02T20:57:23.176377Z","title":"arXiv preprint arXiv:2504.04907 , year=","venue":null,"work_id":"d8c6d1ea-3455-41f7-af0e-eb2489304f19","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2504.04907","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:0f8c996b4b75d534a97271fd6cf88e4edd37f15f3299d741b13369654e62d8a4","observation_id":"4f54c3ac-48db-49f1-a83b-c091f267e172","resolution":{"observed_at":"2026-05-11T12:51:04.036366Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.07826","doi":"10.48550/arxiv.2512.07826","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2512.07826 , year=","venue":"arXiv (Cornell University)","work_id":"c4b3187b-7b77-43e4-a313-26d23620d5aa","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:50d6943351faec4b873f0d1ae547f6f141e2cfd81acb61922633b4419fe334bf","observation_id":"09227181-e68c-485b-b41f-72da79208551","resolution":{"observed_at":"2026-05-11T12:51:03.765354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.91186+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.91186+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.22799","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T10:27:56.742672Z","title":"Huynh-Thu, Q","venue":null,"work_id":"8b5960e1-cfbc-46a2-b0ae-e98f990faa4c","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:7444b0c9bf0cc34f26b7a1780448297e4f31e5cc69d08b59732f57e75d8b7d64","observation_id":"6e4307a2-df9b-4922-a401-24adf4841b6e","resolution":{"observed_at":"2026-05-11T12:51:04.053309Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15252","last_updated":"2024-10-14T04:08:53Z","snapshot_observed_at":"2026-07-06T18:34:56.008706Z","submitted_at":"2024-06-21T15:43:46Z","title":"VideoScore: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video Generation","version":3},"cited_work":{"arxiv_id":"2406.15252","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15252","snapshot_observed_at":"2026-07-01T15:45:48.888277Z","title":"Videoscore: Building automatic metrics to simulate fine-grained human feedback for video genera- tion","venue":null,"work_id":"83e89c4c-f783-4a59-9286-357e3be483c3","year":2024},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2406.15252","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:3f6d5db7912bc87fb829ee2a93f673d030bb6653ffdf6f5636c2741e0274f7b5","observation_id":"c9665ed3-4b2b-4ad7-9ce5-ef91a69b4ee7","resolution":{"observed_at":"2026-05-11T12:51:04.183684Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:6e5e521085eecc0dc80b4225c0f54db841ae7726858f40a5e0bf3fbcb230d6db","observation_id":"f5af0c13-da3b-42c4-adea-d3bae9dc93c3","resolution":{"observed_at":"2026-05-11T12:51:04.125403Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"31d53c40-1e84-4c56-a328-600646a58f8a","year":2022},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:257520b200c621467a3b808c4c97144bd83764fe0f21bc20e48481b36ada0fca","observation_id":"5d17476e-fcf0-4501-88e5-6652d083fae3","resolution":{"observed_at":"2026-05-22T19:45:04.828914Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":"8ea3e4e4-bd5e-4c33-b894-36350cd928c5","year":2024},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:49377cc9918c61342363734e52592f67a95fc57eaf7af7a0352724006ef90da2","observation_id":"e8c6461c-8aed-4a14-a096-0e57e14776d0","resolution":{"observed_at":"2026-05-22T19:45:04.831211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (2024) 2, 4","venue":null,"work_id":"51cdfe8f-0ffb-4219-aad2-6f3daa7b3e7c","year":2024},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:36b1b742e52dd5794c19f13e3c24be608e41497e3ab154a793e1652113230f90","observation_id":"6a2e8c76-5c9c-48f5-9488-ea7bd9579f38","resolution":{"observed_at":"2026-05-22T19:45:04.836603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"9fdcf2b1-3010-46aa-9626-51a1d70cf443","year":2024},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:d6c089540d59534abaeac10fbb36722a939a8894559250b3236cd039c681636d","observation_id":"bede773c-2c44-4bbc-934d-2cbadb9f6fa4","resolution":{"observed_at":"2026-05-22T19:45:04.839918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"17ff6ab7-b49b-4aa3-8e44-7405addb5f25","year":2024},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:727b0d9de9cff1fdfb59fd5bd8cea27fee13adac7d28a239eb506c20091cda18","observation_id":"6ac7acfb-08be-49ff-b396-a1aeca5256d3","resolution":{"observed_at":"2026-05-22T19:45:04.762583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Com- puter Vision and Pattern Recognition","venue":null,"work_id":"d2b567a5-d603-4184-bb0d-2082a6a753fd","year":2024},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:4e74c7738ebc65425e83063dc8adddcc1bdc861f9797deb69d180f826f84fd01","observation_id":"1aa385aa-bef8-4eb9-a418-1eeca0bfcf08","resolution":{"observed_at":"2026-05-22T19:45:04.759089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.08668","doi":"10.48550/arxiv.2510.08668","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jiang, Y","venue":"ArXiv.org","work_id":"7a8fdc22-20a2-4741-865e-cb4dfc77234d","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:4b31402936429079566e14051eb42a07fff7becfff77f436544f805f16db0d31","observation_id":"84eab3ba-4a50-4a12-b338-cbb29f745f3e","resolution":{"observed_at":"2026-05-11T12:51:04.243053Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"d47ecbd5-1170-4b89-a849-8c80f9265b40","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:3d67415b8ff6891bf147eb398d9f457299bf3834c12f4178b371543c81b14fbe","observation_id":"98a7fe84-2002-485f-a39e-436583c22303","resolution":{"observed_at":"2026-05-22T19:45:04.825065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"30731f09-d092-4c10-849f-a621fdbb77a6","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:2b8e87713f2570efe832e589f3ef80d4ab44533a0fa480ba013499f88a9cf605","observation_id":"910aad13-a03f-43df-999c-dfb436e01e3c","resolution":{"observed_at":"2026-05-22T19:45:04.820101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":"b7e8f385-b1bf-4c2f-828d-c62577fe8af7","year":2017},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:999ef57c65ab8484104764e4c90e9a168f45f1b3e66c292bbc217ef1d61fe68b","observation_id":"13d7ffae-51a9-4fa2-8687-069a284d29d5","resolution":{"observed_at":"2026-05-22T19:45:04.766354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19907","last_updated":"2025-03-25T17:59:06Z","snapshot_observed_at":"2026-07-06T20:58:36.895584Z","submitted_at":"2025-03-25T17:59:06Z","title":"FullDiT: Multi-Task Video Generative Foundation Model with Full Attention","version":1},"cited_work":{"arxiv_id":"2503.19907","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19907","snapshot_observed_at":"2026-07-03T17:08:42.921278Z","title":"Fulldit: Multi-task video genera- tive foundation model with full attention","venue":null,"work_id":"d3c75fb5-7649-4107-aec0-9801737dfb8e","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2503.19907","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:e0ef2ee60332fc5108216acb24101edcedd6d11925ee36ede3c041dc1429601a","observation_id":"a2f2b7b3-2aab-4796-87f4-1b828f9644d8","resolution":{"observed_at":"2026-05-11T12:51:04.097620Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:46:21.420743Z","title":"Advances in neural information processing systems35, 22199–22213 (2022)","venue":null,"work_id":"b129d20a-1159-4332-a34e-d2a7c1737d76","year":2022},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:2eba6c82550ec5936efe2ea64f3c11e8bb65e3bb608aab2dfa2949b9f8631fff","observation_id":"c7710b13-6fff-41bf-9363-2582b403ccf6","resolution":{"observed_at":"2026-05-22T19:45:04.818531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:16593134d1152e718ab0918739bf978efe160c2ad4f4bbe7a02d5b9ee3bd99b0","observation_id":"0d398dce-f81e-45df-b318-02285048d72c","resolution":{"observed_at":"2026-05-11T12:51:03.861371Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14468","last_updated":"2024-11-03T21:16:54Z","snapshot_observed_at":"2026-07-06T17:48:24.076444Z","submitted_at":"2024-03-21T15:15:00Z","title":"AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks","version":4},"cited_work":{"arxiv_id":"2403.14468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.14468","snapshot_observed_at":"2026-07-04T10:29:44.541818Z","title":"arXiv preprint arXiv:2403.14468 , year=","venue":null,"work_id":"91372074-cd42-4426-bf90-2d27dee1a1c9","year":2024},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2403.14468","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:a02443294b4d02ae97e691f3533896f8a20b2aa0caa3593a6fedb44d40a042b4","observation_id":"e58883ef-2f62-4f55-b899-ea9d05938812","resolution":{"observed_at":"2026-05-11T12:51:04.287346Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:c99a21b742147bd0a912912aca61d2f3577359f6f980a2c52a0a893f14e3e744","observation_id":"27cd712f-594d-4bad-b1f0-99009a0320ef","resolution":{"observed_at":"2026-05-11T12:51:04.303140Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"c9ff3313-cbb8-4c87-9ea8-1b2efc2a588a","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:76b0c1a5c6821af86d9e0fa92ca0017a94e34ec56cf7c4fc7b3b884ed9b8c3ae","observation_id":"c24059df-e2fd-4adf-9f32-8f6d1bfc3bdb","resolution":{"observed_at":"2026-05-22T19:45:04.823460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-04T22:02:38.792513Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"cited_work":{"arxiv_id":"2505.05472","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.05472","snapshot_observed_at":"2026-07-10T07:36:57.986858Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","venue":"cs.CV","work_id":"f2badd0e-c06a-45f9-9d9e-7ceda62176b8","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2505.05472","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:192641e57452b9fd155e275688d6bc3953708c193d87bad07e8721a1f6583944","observation_id":"92b21136-59fa-4d3a-ba62-09cf07365568","resolution":{"observed_at":"2026-05-17T07:24:05.047503Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09943","last_updated":"2024-11-15T04:43:44Z","snapshot_observed_at":"2026-08-06T16:37:49.547342Z","submitted_at":"2024-11-15T04:43:44Z","title":"Zero-shot Voice Conversion with Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2411.09943","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.09943","snapshot_observed_at":"2026-07-04T08:29:41.883949Z","title":"Liu, ”Zero-shot Voice Conversion with Diffusion Transformers,”","venue":null,"work_id":"a2d874f7-bf61-4f6e-8a45-e939f8b9b605","year":2024},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2411.09943","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:c9724f9cb859167a444a2f1d772835e09c9ba4f24a207cc9f63ed105f342acef","observation_id":"a5ef4e07-2da1-43d8-94f8-0df1aa567665","resolution":{"observed_at":"2026-05-11T12:51:04.023382Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11440","last_updated":"2024-03-23T04:58:50Z","snapshot_observed_at":"2026-08-04T15:31:22.733113Z","submitted_at":"2023-10-17T17:50:46Z","title":"EvalCrafter: Benchmarking and Evaluating Large Video Generation Models","version":3},"cited_work":{"arxiv_id":"2310.11440","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.11440","snapshot_observed_at":"2026-07-01T15:45:48.902358Z","title":"Evalcrafter: Benchmarking and evaluating large video generation models","venue":null,"work_id":"7e755299-7217-4af5-a711-0d29a31768fb","year":2024},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2310.11440","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:88fd2fc1de29998425a1942b3610cb384f8015396244fef7de08d252baf0ff5e","observation_id":"1afd451f-3ce8-435d-8514-c72ede652ee4","resolution":{"observed_at":"2026-05-11T12:51:04.086174Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01813","last_updated":"2023-12-26T05:27:46Z","snapshot_observed_at":"2026-07-06T16:42:36.107644Z","submitted_at":"2023-11-03T09:46:05Z","title":"FETV: A Benchmark for Fine-Grained Evaluation of Open-Domain Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":"2311.01813","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.01813","snapshot_observed_at":"2026-06-29T22:54:00.764516Z","title":"Fetv: A benchmark for fine-grained evaluation of open-domain text-to-video gen- eration.arXiv preprint arXiv:2311.01813, 2023","venue":null,"work_id":"71bdaf93-a344-465d-a42b-fb6a5008a527","year":2023},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2311.01813","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:31b9e850586c12e4b2c5b8aff561846f49a2abd18c70122d40d6fead00864b3e","observation_id":"216da338-cbcc-4efc-955b-3425461459dd","resolution":{"observed_at":"2026-05-11T12:51:03.923156Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05363","last_updated":"2024-10-07T17:56:04Z","snapshot_observed_at":"2026-07-06T19:29:14.335016Z","submitted_at":"2024-10-07T17:56:04Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","version":1},"cited_work":{"arxiv_id":"2410.05363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.05363","snapshot_observed_at":"2026-07-08T07:14:45.198485Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","venue":"cs.CV","work_id":"644e2886-7387-436d-ac11-d848af5fcc71","year":2024},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2410.05363","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:5ad1ab4291d06d03d34f8f8e1e97281fbee14870c7b1408f98720c8e6a7da337","observation_id":"a6558052-1313-4c04-a51c-3db5ee0b87b5","resolution":{"observed_at":"2026-05-18T14:40:00.221207Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"09a8f7c4-cc7a-4dcb-bbbf-f6f1785e4fc7","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:f98f19b843412383aa8177033925eac636b514758565653daebaea2f0cc33a76","observation_id":"eb649c18-4c9f-4a86-a8b6-fca162f97b67","resolution":{"observed_at":"2026-05-22T19:45:04.813929Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"pixverse.ai/(2023), accessed: March 3, 2026 4","venue":null,"work_id":"041b90ab-e588-47cb-88af-42ee8765e898","year":2023},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:2979b61ab1fecef8b9df7ac8a83ea5ae7b0f1fd9c20fb61258ad66955de12901","observation_id":"92c38536-02bc-4500-abd8-fac819c910b9","resolution":{"observed_at":"2026-05-22T19:45:04.764311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:fd0279f2ded9313ebe6cbe1647f52b5de7e091fc922e9cc669f7daebd90d6374","observation_id":"02e2aa0d-d6f7-4bd1-83f0-2c3ea9eb37ea","resolution":{"observed_at":"2026-05-11T14:16:26.778393Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AoPS Wiki,https: //artofproblemsolving.com/wiki/index.php/AIME_Problems_and_Solutions, accessed: 2026-03-01","venue":null,"work_id":"c96bd756-4d0a-4cf6-bdfe-a04282f29767","year":2026},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:7bc74786d8f762a7df8da9eb056e66243b6d5e5c55d9f37795fe5d394fb6c9a1","observation_id":"65de20bc-0713-4a33-8362-aa43b89c55bc","resolution":{"observed_at":"2026-05-22T19:45:04.810709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":"2311.12022","doi":"10.48550/arxiv.2311.12022","metadata_source":"pith","pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","venue":"cs.AI","work_id":"9e2a976b-f5ad-4aee-af5c-243fe0fe75d2","year":2023},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:09aaecc066e9989d0e585cf6fccf684c519ef517a152f1bb4740286251cf123f","observation_id":"4b51b408-1063-40fc-9ae3-178ebd680f84","resolution":{"observed_at":"2026-05-11T12:51:04.295877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.10102","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videoworld 2: Learning transferable knowledge from real-world videos.arXiv preprint arXiv:2602.10102","venue":null,"work_id":"0b4227c3-86fe-4f04-97a3-1c1beec9f85b","year":2026},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:74b1432737f15a273a9ae40c05e51297058d891682629a88f9440a8f369ffac0","observation_id":"97326679-9731-4b33-8030-ee6873eff826","resolution":{"observed_at":"2026-05-11T12:51:04.104580Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9438b9f0-ff8e-4df6-87f9-68ec33f78ee9","year":2026},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:a68b489acad2bbbf6432ba8392aca9ae385fb6aac69dc8a0ae5dad537182f5bb","observation_id":"298a8e46-9e1a-422b-948e-049929df1a85","resolution":{"observed_at":"2026-05-22T19:45:04.812378Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:9050068b318351ca82451879b914b478d4281ac04da77c952b69f6337b437ef9","observation_id":"d55cae8b-62ff-4634-900c-ff5b9440ef24","resolution":{"observed_at":"2026-05-16T01:35:37.953991Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceed- ings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":"5288e6c4-9596-435a-a2d8-af431b4f5f6f","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:d0658a5a840109504974cbbd5a9e9b598a0b72d5e69358772aa31a61a983cc13","observation_id":"53934287-e432-4800-ae0d-82469cf8ea96","resolution":{"observed_at":"2026-05-22T19:45:04.808678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: The Twelfth In- ternational Conference on Learning Representations (2024)","venue":null,"work_id":"527bc3b0-79f9-4ba4-a7c2-7ac7cf01cdd1","year":2024},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:fab44dc70459e60883b043fca640e87538a734b20b93f22a4be00100f3c833ad","observation_id":"b824c7d1-6a8f-4896-8aa3-d9e972877e5b","resolution":{"observed_at":"2026-05-22T19:45:04.806535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence","venue":null,"work_id":"c18b3102-2c08-4c98-b218-5d922444a5c0","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:f067eca4ec2dda7b7c5e0e53b71a5e4a7a7304b9cec09316162d62cf3442bade","observation_id":"af536bcd-cec5-404f-969a-ee91dc10dedc","resolution":{"observed_at":"2026-05-22T19:45:04.821749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09818","doi":"10.48550/arxiv.2405.09818","metadata_source":"pith","pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":"cs.CL","work_id":"2661b9a6-25cc-41a1-8100-612d2b801289","year":2024},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:b3aee5392912d877674067f163d794855979f026b0fd2521114be473760cf194","observation_id":"02ed66ca-ac1b-418d-a9da-7cac3eb0bd4a","resolution":{"observed_at":"2026-05-11T12:51:04.042262Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.16776","last_updated":"2025-12-18T17:08:12Z","snapshot_observed_at":"2026-07-06T22:39:28.855621Z","submitted_at":"2025-12-18T17:08:12Z","title":"Kling-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2512.16776","doi":"10.48550/arxiv.2512.16776","metadata_source":"pith","pith_arxiv_id":"2512.16776","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kling-Omni Technical Report","venue":"cs.CV","work_id":"52d502bd-9d8e-4944-9bf2-cfd097cfdb4e","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2512.16776","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:8812e41022616bd97019e30f303f485314e37c5ea5c6aab420dc95f9fd4229eb","observation_id":"d7443b29-6b35-43ed-98c2-d638fe66a287","resolution":{"observed_at":"2026-05-15T21:00:58.771713Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.73319+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.73319+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:eb7952e20d1e8189e0d1783f3dbf0bbdf502c5f85bba10c909494c0c56429782","observation_id":"06ff4caa-f75b-473e-bc92-ddbc2fb7deae","resolution":{"observed_at":"2026-05-15T02:31:35.128127Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"072ff6df-015e-4776-825d-a2a9137417b8","year":2024},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:671f48c15d2e91c7d9e17b0f74f5246092d59b4f7c54a8f8b1ef13f24016472d","observation_id":"5a6c97c1-9ca6-42de-8a7b-98ab45fc1b44","resolution":{"observed_at":"2026-05-22T19:45:04.838122Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:29de3e9bdbc691c519586bd5d707854739f8323512d2ae1adb622a62514cfc14","observation_id":"a28a771e-2934-455c-8ec8-31c4868f3364","resolution":{"observed_at":"2026-05-11T12:51:03.884926Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-07-06T16:05:35.645037Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":"2308.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-07-11T01:57:50.025885Z","title":"ModelScope Text-to-Video Technical Report","venue":"cs.CV","work_id":"1b1baf78-58ec-44d0-b700-84dff57b2f1f","year":2023},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:7c654646ef32c3ef632616d43ca5b260ccb095e4116e8efe6c7d68d1bc8e7441","observation_id":"813c54ac-e2a3-40fb-b85c-767a1d1d83a3","resolution":{"observed_at":"2026-05-12T19:47:29.701736Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.20159","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:40.917858Z","title":"A very big video reasoning suite","venue":null,"work_id":"4cb52917-7539-4575-a350-92645383c4ef","year":2026},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:b085990064327130e9c0a539056e7f1a5672ab069561cca4c8a820b92bbaf3e9","observation_id":"da7dfb3e-0f17-42a7-a9c7-69e5613ac49a","resolution":{"observed_at":"2026-05-11T12:51:04.313284Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: The Fourteenth International Conference on Learning Representations (2025) 4","venue":null,"work_id":"91e77827-2110-448a-a74e-0eb20ff9f100","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:158c07a49fc255eeaac15c486e10a29400d33dbdd98dab74d22f1488e350ba18","observation_id":"30a700d8-1665-4b73-854b-8111b55dfd0b","resolution":{"observed_at":"2026-05-22T19:45:04.801830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":"2409.18869","doi":"10.48550/arxiv.2409.18869","metadata_source":"pith","pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3: Next-Token Prediction is All You Need","venue":"cs.CV","work_id":"720d288e-fac0-464c-9929-19efd9a52afc","year":2024},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:35db28a59cf401c2f3c59c2005e07551b3b9d2162809e422aa8ffd945bca9a51","observation_id":"8e32b48d-9b2e-4270-9b5e-c5e67edcf36d","resolution":{"observed_at":"2026-05-11T12:51:04.152990Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: International Conference on Medical Image Computing and Computer-Assisted Intervention","venue":null,"work_id":"3ccb5fee-d827-4412-94f8-1a1092da4a34","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:aa1d0ae8134eab803145f625d07ec1ba9fece467567fb804e902d9c81fa54ccc","observation_id":"b2fe887d-48f1-4ba8-971d-401d1f1b8c96","resolution":{"observed_at":"2026-05-22T19:45:04.797728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-04T10:49:46.339959Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:47e14ff761352382ed7ae3be170f4d272ef26e09ce3594ed60698a8669fe0871","observation_id":"f9122528-1e0e-48b7-b0d4-4eca101c9181","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":"2206.07682","doi":"10.48550/arxiv.2206.07682","metadata_source":"pith","pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emergent Abilities of Large Language Models","venue":"cs.CL","work_id":"6ea3375b-837c-4640-a175-be7525aa3c6d","year":2022},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:5994c457a656fcde955855173fb76cc79c9c818b8f26c14c7b182fd702f5994e","observation_id":"eae2bd51-5c8f-4e39-9f79-38d4f658dd8d","resolution":{"observed_at":"2026-05-11T12:51:03.896102Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T00:09:07.34152+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T00:09:07.34152+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:257064ec061e84e52f8ae1b20cace77a5475414e51528389b35557197d402ea4","observation_id":"4daf5438-bf57-48ba-a6d8-7872d39fc58c","resolution":{"observed_at":"2026-05-14T02:16:46.105477Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.21835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T20:57:23.172174Z","title":"Univbench: Towards unified evaluation for video foundation models","venue":null,"work_id":"cb106e3a-cbf8-4ff2-be52-94b449664aeb","year":2026},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:ec3e6a7840179e2719b4279fbe0d92f62ba93dff0580034a7ae174f9e987320f","observation_id":"a224fdf9-b2c8-4cc0-8d01-244147e58636","resolution":{"observed_at":"2026-05-11T12:51:04.276881Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.19834","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T13:38:19.365035Z","title":"Visual generation unlocks human-like reasoning through multimodal world models","venue":null,"work_id":"c93eb550-1241-4a65-ad81-6d0adbd24153","year":2026},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:e182e9908b027d732337e2cd3e3cb508d19def062d9b2d1ce7b79d8d63b9f982","observation_id":"1b6c1e91-4471-490d-8255-80a75efc2616","resolution":{"observed_at":"2026-05-11T12:51:03.999629Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"817ccb83-0191-48ec-94e2-4ae9e2ea5dc8","year":2024},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:61b2fa0d776a5aaf525b4665c50ee148fe2fe2ed67d38a24427657c5d3f8ac6b","observation_id":"a4670310-d722-47b3-bff7-4fbc42650372","resolution":{"observed_at":"2026-05-22T19:45:04.827623Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T04:30:40.782921Z","title":"In: The Thirteenth International Conference on Learning Representations (2025)","venue":null,"work_id":"ba84684d-723b-41f8-bd35-1b35ed23d414","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:14a9e71b11e0e85ffc8b071f2d33e5d32bc70583c5e06847f6e39a00cc247d25","observation_id":"9330d049-5038-4673-ac99-0dafde9484b0","resolution":{"observed_at":"2026-05-22T19:45:04.826854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21059","last_updated":"2026-01-05T02:39:01Z","snapshot_observed_at":"2026-08-03T02:30:08.318253Z","submitted_at":"2024-12-30T16:24:09Z","title":"VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video Generation","version":4},"cited_work":{"arxiv_id":"2412.21059","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.21059","snapshot_observed_at":"2026-07-03T00:07:27.977777Z","title":"VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video Generation","venue":"cs.CV","work_id":"63f252a7-e52d-4e87-b849-d1375bee5b37","year":2024},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2412.21059","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:2aa913cbab183191bb2617d3274735b4e28849e94583b7a44d73ce8a9426bf8b","observation_id":"a12dcc8f-7077-49b0-ab8a-b4fb99cdd0b7","resolution":{"observed_at":"2026-05-16T11:49:14.981353Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":"45026ebe-c4fa-4b31-ada7-fbac10d3c28b","year":2016},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:946c8c268e9e6a209dbc3656f4305fe2204f3c7070b2d9bca2d5c9da23ba5c74","observation_id":"8d14a08f-2413-403e-b909-d341021b9fda","resolution":{"observed_at":"2026-05-22T19:45:04.799893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23452","last_updated":"2025-04-27T02:59:54Z","snapshot_observed_at":"2026-07-06T21:01:00.397040Z","submitted_at":"2025-03-30T14:12:21Z","title":"VideoGen-Eval: Agent-based System for Video Generation Evaluation","version":2},"cited_work":{"arxiv_id":"2503.23452","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23452","snapshot_observed_at":"2026-07-02T21:37:25.426747Z","title":"Videogen-eval: Agent-based system for video generation evaluation","venue":null,"work_id":"99a80f13-a573-405d-9bde-d2ece3e0eb54","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2503.23452","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:c175d1a937d04a0b191c073894590e2b2dcceb769483759249db38ca65523783","observation_id":"f594a219-3105-44df-9bdb-d0002bddcddb","resolution":{"observed_at":"2026-05-11T12:51:03.671354Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-07-31T11:19:06.421362Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":"1809.09600","doi":"10.48550/arxiv.1809.09600","metadata_source":"pith","pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","venue":"cs.CL","work_id":"c87d7e5f-b81a-41c8-beca-f0b9d598aae4","year":2018},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:7afbf5373b3b5e03e1f6e4c07a1c2f00798209f0a1e49427adcf8f1764156d36","observation_id":"a5b6c987-7af5-4a54-bfef-cda3f245644a","resolution":{"observed_at":"2026-05-12T05:05:12.673916Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:406a30f052a7e1fc40f8c526c7415234739b00fc91695ad21f0968856f911452","observation_id":"b37ae508-993f-4659-90a4-5529f0eefdfb","resolution":{"observed_at":"2026-05-11T12:51:03.934837Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04216","last_updated":"2025-06-04T17:57:43Z","snapshot_observed_at":"2026-07-06T21:36:45.605379Z","submitted_at":"2025-06-04T17:57:43Z","title":"UNIC: Unified In-Context Video Editing","version":1},"cited_work":{"arxiv_id":"2506.04216","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04216","snapshot_observed_at":"2026-07-04T16:29:56.632377Z","title":"Unic: Unified in-context video editing","venue":null,"work_id":"309245ca-25dd-4058-af47-e373bcbb1fdf","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2506.04216","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:edb914f848963366d21930805b22e691cb976666c28099a0220d1e52e4485430","observation_id":"389bbf94-25db-4377-be12-2d390b611fab","resolution":{"observed_at":"2026-05-11T12:51:03.953580Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07496","last_updated":"2024-06-11T17:32:21Z","snapshot_observed_at":"2026-07-06T18:29:04.294349Z","submitted_at":"2024-06-11T17:32:21Z","title":"TextGrad: Automatic \"Differentiation\" via Text","version":1},"cited_work":{"arxiv_id":"2406.07496","doi":"10.48550/arxiv.2406.07496","metadata_source":"pith","pith_arxiv_id":"2406.07496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"TextGrad: Automatic \"Differentiation\" via Text","venue":"cs.CL","work_id":"c52b4841-a4b4-4b4e-bc86-8ef6645a9bbb","year":2024},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2406.07496","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:24d3d1d2c8e9058e887852e4250ecc2fe1cb47bc11b24e942b261dc24884588a","observation_id":"dfc04d27-65d8-4eab-9edc-1a5dca5b8bea","resolution":{"observed_at":"2026-05-13T11:27:59.484812Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:25.209279+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:25.209279+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":"2501.13106","doi":"10.48550/arxiv.2501.13106","metadata_source":"pith","pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","venue":"cs.CV","work_id":"38f52461-37fd-4266-bc46-9dea31be2824","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:78d6f1bd91912256a9e90b8f907b4e9b694faae275dea2fbd35a2a7f4239a570","observation_id":"0cd7821b-5897-4ccd-9f09-285ea8ed333c","resolution":{"observed_at":"2026-05-11T12:51:03.979870Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Journal of Computer Vision133(4), 1879–1893 (2025)","venue":null,"work_id":"49d53df6-53e7-4473-b00e-68deb4d81764","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:fb0294b73c0deda19322f852814e0608d75deab85b08815ad84b5152fbd77e82","observation_id":"babd594d-de25-4a6a-9780-46494b97dec0","resolution":{"observed_at":"2026-05-22T19:45:04.798095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04618","last_updated":"2026-03-29T09:18:02Z","snapshot_observed_at":"2026-07-06T22:31:49.574184Z","submitted_at":"2025-10-06T09:30:18Z","title":"Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models","version":3},"cited_work":{"arxiv_id":"2510.04618","doi":"10.48550/arxiv.2510.04618","metadata_source":"pith","pith_arxiv_id":"2510.04618","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models","venue":"cs.LG","work_id":"c1d09cf9-9176-403d-8028-630bbc0cbc5d","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2510.04618","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:1f80553da7fe5b0d4990b901c1b28a6c8dbf18a97e78486ec42c0b619328f00f","observation_id":"01e1f432-0791-4a24-a933-309174507fc5","resolution":{"observed_at":"2026-05-12T16:44:08.223014Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:03.57435+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:03.57435+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":"83b9d63a-af3a-4d80-b8a5-51a3259089ea","year":2018},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:9df6d119c88123fc114cc7bdf91d74e6cc96705684dedee4f26f583884fb4118","observation_id":"2f906ba5-9822-4877-8bf1-634876cf3c39","resolution":{"observed_at":"2026-05-22T19:45:04.805628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03456","last_updated":"2024-10-09T01:01:34Z","snapshot_observed_at":"2026-08-03T12:53:03.694919Z","submitted_at":"2024-10-04T14:14:28Z","title":"Dynamic Diffusion Transformer","version":2},"cited_work":{"arxiv_id":"2410.03456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.03456","snapshot_observed_at":"2026-07-11T01:07:45.204188Z","title":"Dynamic diffusion transformer","venue":"cs.CV","work_id":"7bf49bde-dc20-42f0-a7c3-dc12f0b1bdc6","year":2024},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2410.03456","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:d4ff4db4e9e7168a1e4cd9a7f55bbc8dd5d221723c6dce42e8a7647604ab16dd","observation_id":"6b226fd3-8636-40ff-8536-1c12f81a988a","resolution":{"observed_at":"2026-05-11T12:51:04.119874Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: The Thirteenth International Conference on Learning Representations (2025)","venue":null,"work_id":"645ca2a2-2c82-4a2d-9323-591bf936ea8c","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:3ceb434eca5d9e2a54e1d59a62d0571121b8ad8ce615f3abd6c88450ea8029e5","observation_id":"fb6f6736-e25d-42ce-8de7-fde8528464fb","resolution":{"observed_at":"2026-05-22T19:45:04.784661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01910","last_updated":"2023-03-10T17:20:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-03T15:43:03Z","title":"Large Language Models Are Human-Level Prompt Engineers","version":2},"cited_work":{"arxiv_id":"2211.01910","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01910","snapshot_observed_at":"2026-07-04T15:29:56.107259Z","title":"Large Language Models Are Human-Level Prompt Engineers","venue":"cs.LG","work_id":"29231305-69fd-45ff-b0cd-4dc3bd9d798e","year":2022},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2211.01910","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:11f74dfa097f0c25aacca859353174fa9910e7d6984577679f89232795e8d9b0","observation_id":"b820b6b5-9595-4b4c-8f4b-43be5c6e4f99","resolution":{"observed_at":"2026-05-24T09:43:26.534305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b7632c98-7c9a-441b-b670-3ae5bb0e5dfc","year":null},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:26d0108579ab400e90912c4c07f00f93b394e808f4ac93bc6ba6cdc8461cbce3","observation_id":"27ff338b-f6df-4a15-bddf-c75c8d9dd94c","resolution":{"observed_at":"2026-05-22T19:45:04.793229Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b31c3ae7-65df-4600-83e4-6d37d9d70c20","year":null},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:45531bfd5d1754ab3bcf7bcf7a5e0e48b2ed2d9ee4a5dd053fb6c6896cae8743","observation_id":"092f5470-8455-4fdb-81cd-7f5cabcb7460","resolution":{"observed_at":"2026-05-22T19:45:04.781175Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0e93edca-97d8-4b4d-927e-2c874bd653fe","year":null},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:e31e604d430a804ca7c4fe6b868cf6c9327e7b8fbc4dfcaf6c62a74002a89cf7","observation_id":"74ae64fb-f936-4b7e-8bde-9318a5bf4f7c","resolution":{"observed_at":"2026-05-22T19:45:04.777744Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d572a186-de6e-4667-8bbf-f8445bdfdc0c","year":null},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:35fb437b752c89db621d8c837b62a32635e2ea8b00e0c1b5ebc649ffe0dfc4c5","observation_id":"97b84dee-3dba-4f33-a149-9423021955ea","resolution":{"observed_at":"2026-05-22T19:45:04.815900Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b15cb46f-02bd-4e06-bb0c-fe96e26cbc9d","year":null},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:279845ac584a0922f3f11313a0723e6a059577cf4841f4aa1d59c78323bb5c82","observation_id":"c5aa8b00-35ba-4a68-99bc-e4eb20c77a43","resolution":{"observed_at":"2026-05-22T19:45:04.783091Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"0[integer represents the data point]","venue":null,"work_id":"effa916f-bb8d-44cb-be31-d2209d2451dc","year":null},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:4691def7a4ccfc7477c537750016d1da6769c510c76d478adb570841e290d7a6","observation_id":"9c2bf64f-dca5-4700-9d3e-e826571b4d72","resolution":{"observed_at":"2026-05-22T19:45:04.788472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"You should locate the most important and recurring weakness_correlation","venue":null,"work_id":"9f0f8a43-c46c-465f-a337-497d632fda09","year":null},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:46c6bbe724d054520211fa5902994ccaaf67ff4c7ad9cce8c3599cca100aef0c","observation_id":"77462e89-3a5d-4f8f-9141-5900d412e6f8","resolution":{"observed_at":"2026-05-22T19:45:04.803777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"You can reflect on the mistakes of the reasoning process in the model_evaluation grounded on the video","venue":null,"work_id":"72412dd5-32d3-4f89-9e4b-e3dd7c3b1280","year":null},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:ccf9ffd3721c3b01778e36797952f8308e6d746a61e024caaed473073b57e73f","observation_id":"0fa71fd8-6ec9-4c3b-b0a2-9f6bedb88f52","resolution":{"observed_at":"2026-05-22T19:45:04.776267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Output Format:\\","venue":null,"work_id":"c29a8180-9b0d-459d-bc69-8a04f7422cd5","year":null},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:bbf27488f3b14604c8ba5dd1ae0a7170878a01bd82983fbd49e5ebbf079cba61","observation_id":"033c3046-f612-4d23-990c-6f8727207943","resolution":{"observed_at":"2026-05-22T19:45:04.843248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7090f7aa-7749-40f4-8b0e-a6eb603d4b73","year":null},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:ba97c7b816ed3ef507ffe35395e7dc72779dbc811daed220d9414e00efc4d45a","observation_id":"efe822ac-6993-46af-abc6-028907ae918c","resolution":{"observed_at":"2026-05-22T19:45:04.841390Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"91d330a1-08c6-42df-8adb-225cc612a1ed","year":null},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:5cac317d5d38a13ff39ce8fe81cd2eca96056afdc83de5f7be20af0433734497","observation_id":"22c4f212-68a8-48ef-b513-b693e3bbd36e","resolution":{"observed_at":"2026-05-22T19:45:04.772828Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"reasoning","venue":null,"work_id":"951741fd-0239-4faf-b9c7-bd9d34b426bf","year":null},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:fb2a54edcca1a0ab67816bb89b03b32d2c3996b4a89b87371c6999e9786baf60","observation_id":"b32484b9-03d1-4b51-b22d-a33b8f6059b7","resolution":{"observed_at":"2026-05-22T19:45:04.773819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"It details: what the video has presented now (the weakness) and what it should have presented","venue":null,"work_id":"80a778d5-18c0-4eb6-a3af-3dfe3cb5a032","year":null},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:c2d44037d18c5240566f01a878e0e8a512e04f7cb7c9aca9c9b0afb0eb7414f2","observation_id":"1b1a68f5-1ad5-4324-855c-56d12e797c63","resolution":{"observed_at":"2026-05-22T19:45:04.846946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"It details the weakness of the video","venue":null,"work_id":"bf229c02-7d26-46f6-ba9b-da1f4a1eda16","year":null},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:d63a0b9bba0ce1a3d785c1d0f8b818e960a9e35268ec29f2f39f07640e9f8a06","observation_id":"4cbeb9eb-2b60-4a1a-8552-02e89fa97245","resolution":{"observed_at":"2026-05-22T19:45:04.767877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":41,"parse_uncertain":1,"unresolved":14,"verified_exact":11,"verified_fuzzy":33},"total_outbound_references":103},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 103 outbound references and 3 inbound Pith citation observations for arXiv:2604.19193."}