{"as_of":"2026-08-10T06:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5863429d064e92ca2a429f9c1731bd5883fc4bd707e6089d978fbee4bb9bd5e8","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:01:29.172482Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T19:41:58.268576Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04036","snapshot_observed_at":"2026-08-03T19:41:58.268576Z","title":"Presentagent: Multimodal agent for presentation video generation.arXiv preprint arXiv:2507.04036, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22973","last_updated":"2026-06-22T15:51:03Z","snapshot_observed_at":"2026-08-03T19:41:54.757475Z","submitted_at":"2025-11-28T08:25:59Z","title":"BIFE: Better Interaction, Fewer Errors for Minute-Long Video Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T19:41:58.268576Z"},"links":{"cited_paper":"/paper/2507.04036","citing_paper":"/paper/2511.22973"},"observation_digest":"sha256:ebf7423e684e6bc6dc9a321d88b26a6fecf03482553f11e65369ba1f3819f8f7","observation_id":"7111bdd9-9630-4eaa-b5a4-aa5db3658a83","resolution":{"observed_at":"2026-08-03T19:41:58.268576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04036","snapshot_observed_at":"2026-07-12T09:30:41.159870Z","title":"Presentagent: Multimodal agent for presentation video generation.arXiv preprint arXiv:2507.04036, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02590","last_updated":"2026-07-01T07:01:40Z","snapshot_observed_at":"2026-08-10T05:39:44.898424Z","submitted_at":"2026-07-01T07:01:40Z","title":"OmniPresent: Generating Coherent Presentation Suites from Scientific Papers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T09:30:41.159870Z"},"links":{"cited_paper":"/paper/2507.04036","citing_paper":"/paper/2607.02590"},"observation_digest":"sha256:efaef73ac91d540d6267cda9b6654a77280b96690b2e4514eb45da1ec5524254","observation_id":"95488604-1410-474a-8483-f99895a38273","resolution":{"observed_at":"2026-07-12T09:30:41.159870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04036/citation-record","integrity":"/paper/2507.04036/integrity","json":"/paper/2507.04036/citation-record.json","paper":"/paper/2507.04036"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T20:01:28.433094Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:28.433094Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:97ed637e89b4d97d130ceab71e4fb6dea7f68cddea2a6c9962c7c09e78197fe3","observation_id":"8c888856-2c80-426c-9a26-0aae806c6ef8","resolution":{"observed_at":"2026-08-06T20:01:28.433094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.668582Z","title":null,"venue":null,"work_id":"9f66268e-6fb0-4ab3-878d-452a1acd1633","year":2024},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:28.569354Z"},"links":{"citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:ed6fbf39268ea8551a23f7855a5b0f169ac479ea1256aa3f8725f8350ae7f8d2","observation_id":"1e7c8d37-d7df-4fcd-8a75-838a4cb2c463","resolution":{"observed_at":"2026-08-06T20:01:29.670856Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T20:01:28.715034Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:28.715034Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:382e336ce3edbac18f7f4cdf6780c53b8355ba0208ba5c591342b535a1e37ffd","observation_id":"1983defb-0945-4889-b021-e1d98d195e20","resolution":{"observed_at":"2026-08-06T20:01:28.715034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-06T20:01:28.793825Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:28.793825Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:308fe03b20fc59b84279c2e4b8783f8123b6b6553556c70f6b09b9b645d6eba8","observation_id":"88a157cb-a991-44fe-a0be-9b921b80eafc","resolution":{"observed_at":"2026-08-06T20:01:28.793825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08400","last_updated":"2021-04-16T23:04:52Z","snapshot_observed_at":"2026-08-08T16:05:19.690214Z","submitted_at":"2021-04-16T23:04:52Z","title":"Structure-Aware Abstractive Conversation Summarization via Discourse and Action Graphs","version":1},"cited_work":{"arxiv_id":"2104.08400","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.08400","snapshot_observed_at":"2026-08-06T20:01:29.559352Z","title":"Structure-Aware Abstractive Conversation Summarization via Discourse and Action Graphs","venue":"cs.CL","work_id":"4899d63f-aa91-4deb-89d4-edfe9deaa99c","year":2021},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:28.960148Z"},"links":{"cited_paper":"/paper/2104.08400","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:b9cbeb1c93a4310bfd293312f783e6d9530cdc90c1c33669e7db65c6dceea01c","observation_id":"b8208639-f3d4-418f-b57b-3510eb76ba11","resolution":{"observed_at":"2026-08-06T20:01:29.561919Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.662574Z","title":null,"venue":null,"work_id":"9597da88-3780-4966-80dc-fa5eb3371ddc","year":2024},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:28.993820Z"},"links":{"citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:cdd84f049a5c2c351b6f5073b6ca9582bcbe0ef64f58558db2d3364d49c479bc","observation_id":"0ed332b6-4134-4a7a-a66a-3c1564009960","resolution":{"observed_at":"2026-08-06T20:01:29.664601Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-06T20:01:29.043152Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.043152Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:1be43a13b47990d0520ed47823acef74e9e4d70ded7b0c61ec39ba3feef6f149","observation_id":"224f5bd7-7d46-4e52-9b9a-53f049291259","resolution":{"observed_at":"2026-08-06T20:01:29.043152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.655906Z","title":null,"venue":null,"work_id":"531e2323-6ed3-4986-9d51-34536ff03f0e","year":2022},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.047123Z"},"links":{"citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:8da9f8dea6d02edb0136099810f2ed6ae32fda8f172ab9d3b65f169d1c80cf51","observation_id":"1a67b510-e71b-4042-ab2b-505d9b1d4613","resolution":{"observed_at":"2026-08-06T20:01:29.658073Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00912","last_updated":"2025-06-19T19:27:02Z","snapshot_observed_at":"2026-08-09T12:52:30.918505Z","submitted_at":"2025-01-01T18:09:32Z","title":"AutoPresent: Designing Structured Visuals from Scratch","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00912","snapshot_observed_at":"2026-08-06T20:01:29.060673Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.060673Z"},"links":{"cited_paper":"/paper/2501.00912","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:976d43fbd05aaa0a7a1bb2d7672c148dee0bba002b7a95f406562cde397057d3","observation_id":"94db5d95-d83a-4d52-920d-7c92e15c56fa","resolution":{"observed_at":"2026-08-06T20:01:29.060673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06940","last_updated":"2023-07-13T17:57:13Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:57:13Z","title":"Animate-A-Story: Storytelling with Retrieval-Augmented Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06940","snapshot_observed_at":"2026-08-06T20:01:29.063984Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.063984Z"},"links":{"cited_paper":"/paper/2307.06940","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:e2e2464bb3abfcc6923f6c29ce8e80201520f023f5415dd987fdc3a0acbfa44b","observation_id":"26aa9c68-8bfe-4f3d-8223-5b4d8b68b925","resolution":{"observed_at":"2026-08-06T20:01:29.063984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.649528Z","title":null,"venue":null,"work_id":"a90a7ae2-d769-46de-ba4a-f7cf8be65ad7","year":2023},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.066441Z"},"links":{"citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:87ff57bcd859fd92a04a50aba9576269c2b5f063d2b22923decb3cd056beb581","observation_id":"9e819c4f-dea6-4ea6-938f-68a682b9c7a7","resolution":{"observed_at":"2026-08-06T20:01:29.651742Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.13461","last_updated":"2019-10-29T18:01:00Z","snapshot_observed_at":"2026-07-06T08:33:12.534026Z","submitted_at":"2019-10-29T18:01:00Z","title":"BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.13461","snapshot_observed_at":"2026-08-06T20:01:29.068517Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.068517Z"},"links":{"cited_paper":"/paper/1910.13461","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:18092cb3ddf1ef321c862f2971fb1070a9ebd19400a8a14280e821fa6c0cff43","observation_id":"7432ab6a-fd75-46f2-abbb-4d672fb2d998","resolution":{"observed_at":"2026-08-06T20:01:29.068517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T20:01:29.070705Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.070705Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:1c59a6a963f2333d472f48ce71a53116d970f208f7aba0b347aaa00d3a2caabd","observation_id":"539fab81-7e54-484a-800f-50c400b1b6c9","resolution":{"observed_at":"2026-08-06T20:01:29.070705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00398","last_updated":"2023-09-07T08:11:01Z","snapshot_observed_at":"2026-07-06T16:13:15.274672Z","submitted_at":"2023-09-01T11:14:43Z","title":"VideoGen: A Reference-Guided Latent Diffusion Approach for High Definition Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00398","snapshot_observed_at":"2026-08-06T20:01:29.072774Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.072774Z"},"links":{"cited_paper":"/paper/2309.00398","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:5363b93c9292b8195e487ba9d59aabc4ffe3419af2bf55e51358cfb210b07131","observation_id":"d594df54-74ca-4f9d-a7c0-8ed5ff2fc62f","resolution":{"observed_at":"2026-08-06T20:01:29.072774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10227","last_updated":"2024-06-14T17:59:08Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:59:08Z","title":"VideoGUI: A Benchmark for GUI Automation from Instructional Videos","version":1},"cited_work":{"arxiv_id":"2406.10227","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.10227","snapshot_observed_at":"2026-08-06T20:01:29.516748Z","title":"VideoGUI: A Benchmark for GUI Automation from Instructional Videos","venue":"cs.CV","work_id":"07b411c2-0596-4a04-8913-90006188d90e","year":2024},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.074771Z"},"links":{"cited_paper":"/paper/2406.10227","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:5dfd234f46f18d8b1bd5293c47c154f54c40cce2485bbb1ef342a6c9a8ad8fde","observation_id":"2eee608d-98fc-44ba-9e0e-63a0d028d367","resolution":{"observed_at":"2026-08-06T20:01:29.519212Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-06T20:01:29.076779Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.076779Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:af2d1a7e86dc34ceeb5bb395f8f7dc8cd96ac4b1bfe995d0e7aa8d057a44242d","observation_id":"2fd21acb-63aa-437f-97d1-f4854ec9f7cb","resolution":{"observed_at":"2026-08-06T20:01:29.076779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04648","last_updated":"2025-06-06T03:12:20Z","snapshot_observed_at":"2026-08-09T07:24:17.881013Z","submitted_at":"2025-06-05T05:30:30Z","title":"FPSAttention: Training-Aware FP8 and Sparsity Co-Design for Fast Video Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04648","snapshot_observed_at":"2026-08-06T20:01:29.078845Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.078845Z"},"links":{"cited_paper":"/paper/2506.04648","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:cef4f102f2870b044ff849e471799bdf8cc94d88dc32cf010516a32ebd9d1b08","observation_id":"b5e48018-5dff-4b98-a175-551b82a549ee","resolution":{"observed_at":"2026-08-06T20:01:29.078845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11271","last_updated":"2026-04-13T23:08:01Z","snapshot_observed_at":"2026-08-03T02:43:16.180683Z","submitted_at":"2025-02-16T21:18:47Z","title":"OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11271","snapshot_observed_at":"2026-08-06T20:01:29.081498Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.081498Z"},"links":{"cited_paper":"/paper/2502.11271","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:2ebbd0ac292077eb6514de2e6d8b0ed5c50a73f091ca11096a2de5eb310aa6d1","observation_id":"91da6878-55ea-4bd4-95f4-0c90c856511a","resolution":{"observed_at":"2026-08-06T20:01:29.081498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15661","last_updated":"2025-05-06T17:43:11Z","snapshot_observed_at":"2026-08-07T16:50:46.247768Z","submitted_at":"2025-03-19T19:26:17Z","title":"UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15661","snapshot_observed_at":"2026-08-06T20:01:29.083800Z","title":"Rodriguez, Montek Kalsi, Rabiul Awal, Nicolas Chapados, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.083800Z"},"links":{"cited_paper":"/paper/2503.15661","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:1559731a4cdb0e2c6645e966c1d584a74a5117972ec99d7102dce3486903d0bc","observation_id":"7d0b4b6f-1e3b-4012-9595-31c2f688a340","resolution":{"observed_at":"2026-08-06T20:01:29.083800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15796","last_updated":"2022-08-15T20:39:28Z","snapshot_observed_at":"2026-07-06T12:54:19.991343Z","submitted_at":"2022-03-29T17:57:53Z","title":"Unsupervised Text-to-Speech Synthesis by Unsupervised Automatic Speech Recognition","version":2},"cited_work":{"arxiv_id":"2203.15796","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.15796","snapshot_observed_at":"2026-08-06T20:01:29.482055Z","title":"Unsupervised Text-to-Speech Synthesis by Unsupervised Automatic Speech Recognition","venue":"eess.AS","work_id":"746a8103-9e46-4082-a5e7-3597235417b6","year":2022},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.086266Z"},"links":{"cited_paper":"/paper/2203.15796","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:9bc4e5db9041fc66a1513533456243e20e0c0aafef0c0d35d642c2e22fead9f9","observation_id":"376c5d22-5ea4-4e77-836e-2d90a3d977d4","resolution":{"observed_at":"2026-08-06T20:01:29.486456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.088530Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.088530Z"},"links":{"citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:72dc022871e09d7cfd1fb02f26d71a21fce9b52bcb7c5e31699e46d14ebc5e82","observation_id":"211f0bf1-80de-4007-b261-e93d1d319f58","resolution":{"observed_at":"2026-08-06T20:01:29.088530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.643341Z","title":null,"venue":null,"work_id":"cc479eb3-d260-4083-a073-ae791941a93d","year":2021},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.090591Z"},"links":{"citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:ddeeabfcaecffffe35776fccd3832a5c5b5e0015846113d84b61c08faa5206d0","observation_id":"2fe2d6b6-f18a-47d0-80e3-05fa14eef9b6","resolution":{"observed_at":"2026-08-06T20:01:29.645601Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-06T20:01:29.092791Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.092791Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:53b2473995bc20cad9ec7569e4970afa832229d6b3803f71a84dcbe6fd41e24e","observation_id":"7d91f3dc-3361-40e7-9c90-5fae0056b1a9","resolution":{"observed_at":"2026-08-06T20:01:29.092791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.095189Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.095189Z"},"links":{"citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:5d5b6ab2568a97f35b2b1c85bb8a5bdd30e2579da2ce08f8e3426e533406a070","observation_id":"45e9d53e-ec2e-48c7-af64-a1abd50481d2","resolution":{"observed_at":"2026-08-06T20:01:29.095189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04761","last_updated":"2023-02-09T16:49:57Z","snapshot_observed_at":"2026-07-06T14:50:07.491434Z","submitted_at":"2023-02-09T16:49:57Z","title":"Toolformer: Language Models Can Teach Themselves to Use Tools","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04761","snapshot_observed_at":"2026-08-06T20:01:29.097148Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.097148Z"},"links":{"cited_paper":"/paper/2302.04761","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:29d4f686eb9fa338afe65bc2fff1d7e515f7376751022e49d698e89c2d46771d","observation_id":"ea3df4ac-9fa5-4d50-b165-978d2dfe9784","resolution":{"observed_at":"2026-08-06T20:01:29.097148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.633613Z","title":null,"venue":null,"work_id":"4a420174-cbed-4d27-8306-b88b98e13206","year":2024},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.099566Z"},"links":{"citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:f8026764fbe04a6af6eda4f09f2671e472c97ebfdddb1e58523cc9d1765bc048","observation_id":"3d92604c-22f3-4e69-ab1b-a0ab736b2cec","resolution":{"observed_at":"2026-08-06T20:01:29.635684Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-10T01:55:36.393625Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15406","snapshot_observed_at":"2026-08-06T20:01:29.101657Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.101657Z"},"links":{"cited_paper":"/paper/2505.15406","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:554c448217c175cce08f1b64940737b754ba658e9cc195bb068a5ef027833145","observation_id":"3c24cbcf-69cf-4df7-b40a-5d88ccaa7dba","resolution":{"observed_at":"2026-08-06T20:01:29.101657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00781","last_updated":"2024-10-16T19:29:14Z","snapshot_observed_at":"2026-07-06T19:43:42.287026Z","submitted_at":"2024-10-16T19:29:14Z","title":"Hazards in Daily Life? Enabling Robots to Proactively Detect and Resolve Anomalies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00781","snapshot_observed_at":"2026-08-06T20:01:29.103900Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.103900Z"},"links":{"cited_paper":"/paper/2411.00781","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:d00b733ea0162e6c6c0020190e965aca0fd6b9449519545ddf96f8f2460ab3f8","observation_id":"86bda43d-60f2-4d9a-8427-55fae60e7051","resolution":{"observed_at":"2026-08-06T20:01:29.103900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16517","last_updated":"2025-05-24T10:44:27Z","snapshot_observed_at":"2026-08-10T01:55:19.425242Z","submitted_at":"2025-05-22T10:57:07Z","title":"ManipLVM-R1: Reinforcement Learning for Reasoning in Embodied Manipulation with Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16517","snapshot_observed_at":"2026-08-06T20:01:29.106548Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.106548Z"},"links":{"cited_paper":"/paper/2505.16517","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:e4a9dd116df3e1b2fa774d96a65b942b47821bbd7955c531ffaf6b819de092a9","observation_id":"21327823-47e2-4976-a1c2-77615640adec","resolution":{"observed_at":"2026-08-06T20:01:29.106548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.108567Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.108567Z"},"links":{"citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:747e964651b9710835e11609f9143a5f210c942de84c50f571c8fc969ab58436","observation_id":"ce08266a-9130-4271-9094-73e58b3c01e7","resolution":{"observed_at":"2026-08-06T20:01:29.108567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19723","last_updated":"2025-06-27T08:25:48Z","snapshot_observed_at":"2026-08-07T22:32:37.258577Z","submitted_at":"2024-12-27T16:21:58Z","title":"OS-Genesis: Automating GUI Agent Trajectory Construction via Reverse Task Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19723","snapshot_observed_at":"2026-08-06T20:01:29.110892Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.110892Z"},"links":{"cited_paper":"/paper/2412.19723","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:5a7a355919927c4c30095acd61e94c7dc2f5b7ca11daeb5bd7bceb1732f27ddc","observation_id":"16049078-62be-42d1-a50e-9ccac96c5712","resolution":{"observed_at":"2026-08-06T20:01:29.110892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.627274Z","title":null,"venue":null,"work_id":"6f3b0ed8-a338-4be3-b870-45fb82403d59","year":2018},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.113166Z"},"links":{"citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:79b843b8b853565c467534e231e47dc470e4d7540fa7d0d0e29e6c6af74f2b86","observation_id":"01355dde-d6a2-459d-85e7-52f3ae7a23d3","resolution":{"observed_at":"2026-08-06T20:01:29.629435Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.115335Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.115335Z"},"links":{"citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:6b9e9bcbc3cc7e0ad2119511373d7e160881f762876351e5290480525d6db84d","observation_id":"67b53045-bf75-4f75-8880-745f237be6e1","resolution":{"observed_at":"2026-08-06T20:01:29.115335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.621179Z","title":null,"venue":null,"work_id":"fbcbb1d5-e3fb-4034-93fb-93ac587e5212","year":2024},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.118180Z"},"links":{"citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:3d8f03ca0cc829086ddcbe6638c8eb2a1249e2a229633c031c8ef4c2829a8c3e","observation_id":"ae5a6918-b9a4-4818-842d-42d62a5bbd7c","resolution":{"observed_at":"2026-08-06T20:01:29.623264Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T20:01:29.120314Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.120314Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:8fa3c3b9142f8cfb12819bb5ff7a8f6de9515d0650ae19f4b4a784b7aa562a20","observation_id":"d39aec71-f6ff-46c5-b807-f5cc87ce74b1","resolution":{"observed_at":"2026-08-06T20:01:29.120314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16741","last_updated":"2025-04-18T18:14:31Z","snapshot_observed_at":"2026-08-02T14:58:44.167588Z","submitted_at":"2024-07-23T17:50:43Z","title":"OpenHands: An Open Platform for AI Software Developers as Generalist Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16741","snapshot_observed_at":"2026-08-06T20:01:29.122704Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.122704Z"},"links":{"cited_paper":"/paper/2407.16741","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:fe4faaf1bf3c60f084fb16e0876ae9b3dfa1508066ed005231134762b98e6eb4","observation_id":"49e8f1e3-eb15-4360-b7c2-2deda2d51ef4","resolution":{"observed_at":"2026-08-06T20:01:29.122704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02006","last_updated":"2025-09-14T09:13:39Z","snapshot_observed_at":"2026-08-09T09:53:28.792027Z","submitted_at":"2024-11-04T11:50:58Z","title":"Foundations and Recent Trends in Multimodal Mobile Agents: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02006","snapshot_observed_at":"2026-08-06T20:01:29.125527Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.125527Z"},"links":{"cited_paper":"/paper/2411.02006","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:359a0157fe6bfee658bd1e877f4566a5e879923d618a15e84a0900e407ee0b5c","observation_id":"12b6aed6-28ce-4f33-9182-757289dc56b1","resolution":{"observed_at":"2026-08-06T20:01:29.125527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-06T20:01:29.127674Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.127674Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:803ede69d656c178782c24f4a5179b8596fc89333b263cf703954fc06fd62c8f","observation_id":"a53afc44-f45d-41ad-9a2e-36e6e8c9b45a","resolution":{"observed_at":"2026-08-06T20:01:29.127674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-06T20:01:29.129735Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.129735Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:32083fc7893083d0fa2e6472b53fe7966eb15c02cc4ad289b3e2bc7d7011fcda","observation_id":"cfe0fcee-d956-44f2-9803-31d2e0e4053d","resolution":{"observed_at":"2026-08-06T20:01:29.129735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.614542Z","title":null,"venue":null,"work_id":"976c82d8-1357-4603-9bd1-234f96ed257d","year":2025},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.133015Z"},"links":{"citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:12ee9921abc7a7e665b7640b6e83f15c0fa4ad458b57eb842c4c606792ef763e","observation_id":"a46645cd-3d1c-4db9-b8a3-aff88a0a87b4","resolution":{"observed_at":"2026-08-06T20:01:29.616942Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.608321Z","title":null,"venue":null,"work_id":"c610ccbc-429d-451d-8e97-2848f8836486","year":2024},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.135592Z"},"links":{"citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:95113ef1e4ab1e8934d6f58311201be7457de9cb6b90c0005ba60d5b05dbdc92","observation_id":"3ba96308-d4b5-40ef-8639-ee575a2b19da","resolution":{"observed_at":"2026-08-06T20:01:29.610446Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00812","last_updated":"2024-01-08T16:22:42Z","snapshot_observed_at":"2026-07-06T17:10:32.750276Z","submitted_at":"2024-01-01T16:51:20Z","title":"If LLM Is the Wizard, Then Code Is the Wand: A Survey on How Code Empowers Large Language Models to Serve as Intelligent Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00812","snapshot_observed_at":"2026-08-06T20:01:29.138233Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.138233Z"},"links":{"cited_paper":"/paper/2401.00812","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:668b6adddaae3d65ca7ba4bd244176df082788806da531df2792520151efc484","observation_id":"3c23a90b-6986-430d-86d7-7b7ac803d0b6","resolution":{"observed_at":"2026-08-06T20:01:29.138233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.601712Z","title":null,"venue":null,"work_id":"dc9d7736-dd14-48e1-9c3a-e8ba76f86a31","year":2023},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.140908Z"},"links":{"citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:816a14dd4b683775510448d097ed2b83d3c73a7b8d99c76a5d51a6084b06814b","observation_id":"093e1986-e296-40c3-a1b8-2eba82a8abc1","resolution":{"observed_at":"2026-08-06T20:01:29.604000Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11381","snapshot_observed_at":"2026-08-06T20:01:29.143169Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.143169Z"},"links":{"cited_paper":"/paper/2303.11381","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:15da7ea2c6a3a3995c7d8cfb7da401415a50ffd98baa933e78168e708a9facec","observation_id":"cb17e108-8c89-4af7-bf13-994577aa12d7","resolution":{"observed_at":"2026-08-06T20:01:29.143169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-06T20:01:29.145529Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.145529Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:74132c7105186d8c31779a0acd6952413645eea9dd9e07f9c804aba7d0a8719c","observation_id":"4529811b-4832-47df-9ae5-e4180b04240e","resolution":{"observed_at":"2026-08-06T20:01:29.145529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.147965Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.147965Z"},"links":{"citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:6843914b29b7b0a02b2842cfda3620ff0aede132ce079dfafbc0866a52203e79","observation_id":"a0e4689e-5467-46cc-959d-1fc467deadbe","resolution":{"observed_at":"2026-08-06T20:01:29.147965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03864","last_updated":"2025-08-07T06:34:52Z","snapshot_observed_at":"2026-07-06T19:28:08.374354Z","submitted_at":"2024-10-04T18:58:09Z","title":"DOTS: Learning to Reason Dynamically in LLMs via Optimal Reasoning Trajectories Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03864","snapshot_observed_at":"2026-08-06T20:01:29.149835Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.149835Z"},"links":{"cited_paper":"/paper/2410.03864","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:7d49512911ad36a73c1b5a76841a1311997c92ab0c8a60733a28d469f1476d54","observation_id":"88ac403f-f968-4ebe-a156-1159ee29b95b","resolution":{"observed_at":"2026-08-06T20:01:29.149835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06481","last_updated":"2025-04-16T16:45:12Z","snapshot_observed_at":"2026-08-02T08:20:46.856115Z","submitted_at":"2024-11-10T14:41:38Z","title":"KMM: Key Frame Mask Mamba for Extended Motion Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06481","snapshot_observed_at":"2026-08-06T20:01:29.152345Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.152345Z"},"links":{"cited_paper":"/paper/2411.06481","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:dce717efaed9ae71a9c46b6682b587a1dc272b6191faae7ae1f7e2aefa303afa","observation_id":"d525c7a2-99f6-4cc1-9d96-938a6d869311","resolution":{"observed_at":"2026-08-06T20:01:29.152345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10061","last_updated":"2024-07-14T03:12:19Z","snapshot_observed_at":"2026-08-03T17:31:24.474732Z","submitted_at":"2024-07-14T03:12:19Z","title":"InfiniMotion: Mamba Boosts Memory in Transformer for Arbitrary Long Motion Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10061","snapshot_observed_at":"2026-08-06T20:01:29.154828Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.154828Z"},"links":{"cited_paper":"/paper/2407.10061","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:1c54c8c017c1f2133dce1c10082e2de39b282b4cb1dd85eee418b03fd8bf21f0","observation_id":"cbe9c6da-fb73-4065-b58c-08377835204f","resolution":{"observed_at":"2026-08-06T20:01:29.154828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.590879Z","title":null,"venue":null,"work_id":"abbb76c8-cedc-44b0-a8c9-6c06ea8abf9f","year":2024},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.157288Z"},"links":{"citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:5f864784b7d916f3c774102dcc8e12c609c7831f42bba27377c5a3ff2d537519","observation_id":"7cdf0a49-32a4-45c5-a7c1-f182fa2ceabb","resolution":{"observed_at":"2026-08-06T20:01:29.593307Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06955","last_updated":"2025-03-12T01:45:04Z","snapshot_observed_at":"2026-08-07T17:17:55.064185Z","submitted_at":"2025-03-10T06:04:31Z","title":"Motion Anything: Any to Motion Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06955","snapshot_observed_at":"2026-08-06T20:01:29.159405Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.159405Z"},"links":{"cited_paper":"/paper/2503.06955","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:61486f54deb9ec97151587b8f6a4b9ad36172c15afc70ab13149ff1c66b69c33","observation_id":"ef6585ef-abd2-45ff-a142-5324e57784e0","resolution":{"observed_at":"2026-08-06T20:01:29.159405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11286","last_updated":"2024-08-30T19:17:41Z","snapshot_observed_at":"2026-07-06T18:16:11.502190Z","submitted_at":"2024-05-18T13:21:14Z","title":"Motion Avatar: Generate Human and Animal Avatars with Arbitrary Motion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11286","snapshot_observed_at":"2026-08-06T20:01:29.161584Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.161584Z"},"links":{"cited_paper":"/paper/2405.11286","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:a783f6eb3439bab9f18a88658073a038432854a70a68da8d647abcfb249f9b93","observation_id":"f1da34a8-069d-4838-b864-111ed8088c27","resolution":{"observed_at":"2026-08-06T20:01:29.161584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03936","last_updated":"2025-02-21T07:52:39Z","snapshot_observed_at":"2026-08-10T02:36:19.185323Z","submitted_at":"2025-01-07T16:53:01Z","title":"PPTAgent: Generating and Evaluating Presentations Beyond Text-to-Slides","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03936","snapshot_observed_at":"2026-08-06T20:01:29.166158Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.166158Z"},"links":{"cited_paper":"/paper/2501.03936","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:a0320c71a2c8c7a36db92308ca590c1ded507a4f6b12f41b60256f721bf84e0b","observation_id":"e687567a-663b-4744-babe-7ccae67079fb","resolution":{"observed_at":"2026-08-06T20:01:29.166158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.168686Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.168686Z"},"links":{"citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:41ceae0270dd3a14a89e4bf350f0de723b8ec781f50aa7771c47722cfb9ffbbc","observation_id":"fdaa49b5-5483-487c-a631-1e9abc9c2c40","resolution":{"observed_at":"2026-08-06T20:01:29.168686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.172482Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.172482Z"},"links":{"citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:119c42e1a03eca6696abd2b479f4894c17ae8534669d69bb74dd777a4303e277","observation_id":"e030cbe4-6ff5-4983-8a81-176fb28365b1","resolution":{"observed_at":"2026-08-06T20:01:29.172482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 2 inbound Pith citation observations for arXiv:2507.04036."}