{"as_of":"2026-08-03T16:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:deb97e80e51143c6d9bd2a35d3681b763e6de3d58286ac533df37c98f122ca80","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T02:29:42.157339Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T08:44:26.876152Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.11363","snapshot_observed_at":"2026-08-02T08:44:26.876152Z","title":"Presentagent-2: Towards generalist multimodal presentation agents.arXiv preprint arXiv:2605.11363, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04438","last_updated":"2026-07-19T17:59:31Z","snapshot_observed_at":"2026-08-02T18:21:03.059162Z","submitted_at":"2026-07-05T17:59:33Z","title":"ResearchStudio-Reel: Automate the Last Mile of Research from Paper to Poster, Video, and Blog","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T08:44:26.876152Z"},"links":{"cited_paper":"/paper/2605.11363","citing_paper":"/paper/2607.04438"},"observation_digest":"sha256:653cdaaba428eb823b902bab75fa7189c165ad3150309ba532be9842318d91d3","observation_id":"06151ab6-5875-475d-8f3d-03475fa27c04","resolution":{"observed_at":"2026-08-02T08:44:26.876152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.11363/citation-record","integrity":"/paper/2605.11363/integrity","json":"/paper/2605.11363/citation-record.json","paper":"/paper/2605.11363"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.21497","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T01:09:19.186253Z","title":"Paper2poster: Towards multimodal poster automation from scientific papers,","venue":null,"work_id":"503ebe9c-09db-4d71-a0eb-a698dd8a582b","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:2bbd9242998d13cd27c7576f560a99005fb0c6a573802bbb674441868c60167d","observation_id":"dadcfd4b-e521-4cf0-a5f7-c6dbd12b7147","resolution":{"observed_at":"2026-05-13T02:32:06.469529Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Presentagent: Multimodal agent for presentation video generation","venue":null,"work_id":"943a35e6-f682-432c-8183-d064b30ad291","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:7eff861b357f064084a7ab8ca15eb44d64ba30bd7ade162956a26b98f87ab5dd","observation_id":"dca908e0-3930-44ee-bc54-25c4166f53c7","resolution":{"observed_at":"2026-05-13T13:02:49.757200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.05096","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T10:58:02.741963Z","title":"Q., and Shou, M","venue":null,"work_id":"5d9f35c5-146f-4405-9a1e-95d42d634101","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:e0379420bfad8602960cb2ff95f1eaf20e7d89067c0a25b01c8c86939315b099","observation_id":"bf28b32b-a132-46a0-a0c1-93e7cac92259","resolution":{"observed_at":"2026-05-13T02:32:06.475438Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.11253","last_updated":"2026-04-21T04:59:36Z","snapshot_observed_at":"2026-08-03T04:17:38.034073Z","submitted_at":"2025-09-14T12:54:21Z","title":"VideoAgent: Personalized Synthesis of Scientific Videos","version":2},"cited_work":{"arxiv_id":"2509.11253","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.11253","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VideoAgent: Personalized Synthesis of Scientific Videos","venue":"cs.AI","work_id":"ccea2fe9-8014-480b-9d8f-f8bb584263d1","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2509.11253","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:4eb7da71e8d9c0223597d895953746b54772063cb7d78b99d18963a0ed3190f7","observation_id":"cc8e9da5-6959-4f1c-9338-4917e45097e1","resolution":{"observed_at":"2026-05-13T02:32:06.466432Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11604","last_updated":"2026-05-11T04:13:00Z","snapshot_observed_at":"2026-07-30T02:16:51.207980Z","submitted_at":"2025-05-16T18:12:26Z","title":"Talk to Your Slides: High-Efficiency Slide Editing via Language-Driven Structured Data Manipulation","version":5},"cited_work":{"arxiv_id":"2505.11604","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.11604","snapshot_observed_at":"2026-07-03T17:38:44.104644Z","title":"Talk to Your Slides: High-Efficiency Slide Editing via Language-Driven Structured Data Manipulation","venue":"cs.CL","work_id":"08a8c90d-081d-45b8-b976-c759d794e8fb","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2505.11604","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:5c3ae14a2ecfa14ecb34a08be046af6562121bc9e99aa310411b9d378369a243","observation_id":"ebd0c220-9ded-4d65-92c2-c9d60055bc7f","resolution":{"observed_at":"2026-05-13T02:32:06.472581Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:14:59.542426Z","title":"Pptagent: Generating and evaluating presentations beyond text-to-slides","venue":null,"work_id":"78fc4b06-54aa-4e7f-8168-67f7155f5489","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:39788f84f422fd8f9eeefcd6cd1460f98ed3eb19f641154402fbe8332e0d0a97","observation_id":"72818650-064f-4dcc-9249-215894a13ad0","resolution":{"observed_at":"2026-05-13T13:02:49.762408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.11062","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T01:09:19.228225Z","title":"Auto- Slides: An interactive multi-agent system for creating and customizing research presentations","venue":null,"work_id":"2338fa2a-470d-40f4-8c01-b68534ad46c6","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:a65ac25bad10406924941aa094807a279968585253ae15439d3c0ad331aade0c","observation_id":"ab4f3b05-932f-4b06-b539-01fd8e637cc3","resolution":{"observed_at":"2026-05-13T02:32:06.478070Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.03227","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Node-based editing for multimodal generation of text, audio, image, and video","venue":null,"work_id":"eb20644b-ad06-4069-ae04-5e6a3a6f0201","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:f0f145437b6a5f45618add4fa4e9de04d0e88d44cddb010608f15de589e1e4db","observation_id":"371d8d01-54df-4256-8870-04a5cf958f9c","resolution":{"observed_at":"2026-05-13T02:32:06.480754Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-07-06T21:39:08.559358Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"cited_work":{"arxiv_id":"2506.07848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07848","snapshot_observed_at":"2026-07-01T22:56:20.169424Z","title":"Polyvivid: Vivid multi-subject video generation with cross-modal interaction and enhancement","venue":null,"work_id":"b4a9289e-29a2-47d9-8ce8-c72eef2327b2","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2506.07848","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:4003f40e65f6a28c0c5e3bb45adf49c9d5738e9e03131abe1881112b97bccecc","observation_id":"3d7b7d1c-4e97-49d1-9e0f-205daa78cebf","resolution":{"observed_at":"2026-05-13T02:32:06.483612Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":"2505.22647","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-07-04T10:09:44.572116Z","title":"Let them talk: Audio-driven multi-person conversational video generation","venue":null,"work_id":"b6c07d96-7a45-4c6f-9ca7-641329c5a3b5","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:9cb1b5041a4b17bd794f4ebc2fe90b0d09e32637b6040c89b12ffdabf41e96a1","observation_id":"e91fb8d3-1b09-4292-9d6b-8aa21c96918c","resolution":{"observed_at":"2026-05-13T02:32:06.441607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Autopresent: Designing structured visuals from scratch","venue":null,"work_id":"fdaf43d6-f597-48cd-a2ec-dc1c99c5eeb9","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:f4496d52d91621e30e21cbac6e3dcc23faf46b97c8ac008aad4b60b76dc1613e","observation_id":"b49932d2-ed43-4638-8890-6fc98df6d966","resolution":{"observed_at":"2026-05-13T13:02:49.695161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.03197","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:07:25.795531Z","title":"Infinity parser: Layout aware reinforcement learning for scanned document parsing","venue":null,"work_id":"d0239f58-7352-451a-8fe4-c194aa05491e","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:9a6b3bb404a5a8e19cf02817df676f0fb7a82f6e9295cb9acfe5a78f660fb536","observation_id":"f0312a9d-97e9-4134-bf10-12baeb471f50","resolution":{"observed_at":"2026-05-13T02:32:06.415184Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Doc2ppt: Automatic presen- tation slides generation from scientific documents","venue":null,"work_id":"0530045c-3070-410a-8525-1112e63ada9e","year":2022},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:9b694f44e3f795f9d17045145d54de01688f135950b21288fc9c2a1efb32c823","observation_id":"f796951f-2d8a-4733-b4bb-edcb5d882a95","resolution":{"observed_at":"2026-05-13T13:02:49.708349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Slides agent: An intelligent agent for creating and analyzing presentations using large","venue":null,"work_id":"df2125af-0455-4145-bcad-290b6402da8b","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:b91b2bdc12b58355892928c1c0d31be8419ecbfffdad230e8212339463664d94","observation_id":"42ef8323-5ca5-41b8-8b66-f24bdc886cb5","resolution":{"observed_at":"2026-05-13T13:02:49.690919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.04529","doi":"10.48550/arxiv.2512.04529","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"SlideGen: Collabo- rative multimodal agents for scientific slide generation","venue":null,"work_id":"317605f0-d2a5-4fd1-883d-aedddbcbecee","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:44ffa2ee6569a30e8a47382b2500babbc2d0f6c1d0316502f5929b320845d600","observation_id":"74429580-9ced-489c-a3c5-6da378344b90","resolution":{"observed_at":"2026-05-13T02:32:06.407697Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.05571","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T17:38:44.230654Z","title":"Presenting a paper is an art: Self-improvement aesthetic agents for academic presentations","venue":null,"work_id":"0fffe9c3-5cce-4ff3-83a0-cd33f0bf99bc","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:149b288c4d340ddd70c03f0164e42c2e21a1b6d4fe7e6487af08857260c47352","observation_id":"59329108-f988-4074-b80f-c1983545e8b7","resolution":{"observed_at":"2026-05-13T02:32:06.457138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt4tools: Teaching large language model to use tools via self-instruction.Advances in Neural Information Processing Systems, 36:71995–72007","venue":null,"work_id":"c2caa986-1e25-4e77-82d0-cf43c9bf7a70","year":2023},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:e5431c8751df8fa66528271e46d367ff2d2f505ae34f01c51794791325396e17","observation_id":"cf498312-75c4-42dd-92e9-6958df28398c","resolution":{"observed_at":"2026-05-13T13:02:49.727964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"cited_work":{"arxiv_id":"2303.11381","doi":"10.48550/arxiv.2303.11381","metadata_source":"pith","pith_arxiv_id":"2303.11381","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","venue":"cs.CV","work_id":"6dc43db8-227d-438e-8658-0c8acecba08a","year":2023},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2303.11381","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:d436dff04433ed45bb0a9a25421c3aa6107fbe158d1e0419bb486cd0b2074cd5","observation_id":"c0c735ad-5fb9-4cee-b0d3-93f8f5adc520","resolution":{"observed_at":"2026-05-14T01:17:58.977376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Os-genesis: Automating gui agent trajectory construction via reverse task synthesis","venue":null,"work_id":"2c20a654-b7e5-4036-9580-84fdbbcce6d3","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:e41e4fc1fbc01f701aeb756fa4c510983d49f04d1a738690d6a3886b2e1c238c","observation_id":"ca5e12fd-76b9-45a0-9e7f-7bd3e36c8ec3","resolution":{"observed_at":"2026-05-13T13:02:49.680217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00398","last_updated":"2023-09-07T08:11:01Z","snapshot_observed_at":"2026-07-06T16:13:15.274672Z","submitted_at":"2023-09-01T11:14:43Z","title":"VideoGen: A Reference-Guided Latent Diffusion Approach for High Definition Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2309.00398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00398","snapshot_observed_at":"2026-07-04T14:59:55.947520Z","title":"arXiv preprint arXiv:2309.00398 (2023) 6, 1","venue":null,"work_id":"3e0e2f45-9789-4c06-9f52-59d98e898afc","year":2023},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2309.00398","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:d6e20f169e392ed47517e36966996ba3849e00478a0b7fdf838c578feed5adad","observation_id":"72a6e0f9-afd5-412c-990e-12fad2d59c2d","resolution":{"observed_at":"2026-05-13T02:32:06.435877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T16:33:56.494303Z","title":"Phyt2v: Llm-guided iterative self- refinement for physics-grounded text-to-video generation","venue":null,"work_id":"e7e163ce-9a71-481a-b586-bdccc43cfd75","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:3e11c23c2c22ab459268d4f463d04d5cfb139b337e1da4dbf9cd3d3216c36963","observation_id":"e788e6dc-dcf5-4cb9-b020-29fe7d053bc7","resolution":{"observed_at":"2026-05-13T13:02:49.738177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-07-11T00:07:42.878250Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:c5fa60d27662f8bee2731c65318015c2af3714021f714fb759e5fd821d6ffe7c","observation_id":"9a6fdb57-0869-4d03-92ee-a2f67503722a","resolution":{"observed_at":"2026-05-13T02:32:06.444424Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.02567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:36:58.031623Z","title":"Unified multimodal understanding and generation models: Advances, challenges, and opportunities.arXiv preprint arXiv:2505.02567","venue":null,"work_id":"b2e70f99-2155-4021-82c3-540574140c6a","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:9df42fcb04c608e232f1636709712c327396c983630efa9ba3f3f106619aa995","observation_id":"2f886056-ac37-44db-abbc-fb5d28659806","resolution":{"observed_at":"2026-05-13T02:32:06.447724Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-01T22:56:50.755050Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":"2604.15804","doi":"10.48550/arxiv.2604.15804","metadata_source":"pith","pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Qwen3.5-Omni Technical Report","venue":"cs.CL","work_id":"9d0aeac4-3b94-4a09-af62-5e32286fdf5f","year":2026},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:b8cafc51a8bad1fb65f613f05dc7aea56b70fa392d521ddd14249bb450504fcf","observation_id":"5d738567-e7c6-46ff-91ca-6589dbf51a03","resolution":{"observed_at":"2026-05-13T02:32:06.418990Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06955","last_updated":"2025-03-12T01:45:04Z","snapshot_observed_at":"2026-07-06T20:49:37.096479Z","submitted_at":"2025-03-10T06:04:31Z","title":"Motion Anything: Any to Motion Generation","version":2},"cited_work":{"arxiv_id":"2503.06955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.06955","snapshot_observed_at":"2026-07-01T21:56:16.181986Z","title":"Motion anything: Any to motion generation","venue":null,"work_id":"7afe7b27-c2cf-41f9-8832-e4f5cc9f0e3b","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2503.06955","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:cfe9459eeff6c949b47eb56b6fbbeadf7315f9c39846468ddfa880572f40b4ec","observation_id":"f6643a88-8a2c-42d7-8a54-82467eabc718","resolution":{"observed_at":"2026-05-13T02:32:06.423233Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10061","last_updated":"2024-07-14T03:12:19Z","snapshot_observed_at":"2026-08-03T09:44:39.945889Z","submitted_at":"2024-07-14T03:12:19Z","title":"InfiniMotion: Mamba Boosts Memory in Transformer for Arbitrary Long Motion Generation","version":1},"cited_work":{"arxiv_id":"2407.10061","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.10061","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Infinimotion: Mamba boosts memory in transformer for arbitrary long motion generation","venue":null,"work_id":"34218c16-39e9-4032-8b72-69cf6faf57ff","year":2024},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2407.10061","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:3ca6c295d5e5ca7a62650ca157d3e7ebcfd4a271874a2baec5516d5cd686274d","observation_id":"497a87b8-55f1-42c9-9016-e07f2be068d3","resolution":{"observed_at":"2026-05-13T02:32:06.430047Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06481","last_updated":"2025-04-16T16:45:12Z","snapshot_observed_at":"2026-08-02T08:20:46.856115Z","submitted_at":"2024-11-10T14:41:38Z","title":"KMM: Key Frame Mask Mamba for Extended Motion Generation","version":2},"cited_work":{"arxiv_id":"2411.06481","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.06481","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kmm: Key frame mask mamba for extended motion generation","venue":null,"work_id":"ff2e0ac7-c42f-406b-9e0e-4ca2e82e021d","year":2024},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2411.06481","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:6ef3675394286d84fc7d343a349f7df138aef0362e186cca78894e063cb4468f","observation_id":"192b69c6-c65c-4666-9e76-c46796326fb2","resolution":{"observed_at":"2026-05-13T02:32:06.463488Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Motion mamba: Efficient and long sequence motion generation","venue":null,"work_id":"105fc4db-893e-4ff8-9f51-d0a649a7cc63","year":2024},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:edbab59dd659551d39e9f7223f9a37f74078f7d790a2725c44963d111f6b0da0","observation_id":"39adb5c7-7403-4651-b8b3-72cef9de1c0f","resolution":{"observed_at":"2026-05-13T13:02:49.685930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"ccf417c6-61bf-4c14-bde4-7d461fce27e8","year":2023},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:c92b5fd7969abb7735bfcb17769a9d98438f0e2cea00d506322d76b4f7ad1836","observation_id":"629962e1-8b72-465e-ae00-3cdf44883a88","resolution":{"observed_at":"2026-05-13T13:02:49.699752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards generalist foundation model for radiology by leveraging web-scale 2d&3d medical data.Nature Communications, 16(1):7866","venue":null,"work_id":"d6e7a7a7-a0f3-4b5b-883c-a78c2ac644e2","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:cf8108243fdac4a8b7411d218f712e91bfa3f263affdb9f7fc1426e5fa77a4c3","observation_id":"4bcdc1dd-94f4-4e24-ac6f-01404c611947","resolution":{"observed_at":"2026-05-13T13:02:49.720574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mavis: A multi-agent framework for long-sequence video storytelling","venue":null,"work_id":"0c42e827-da8b-4df5-951d-ddee3fa83d45","year":2026},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:13068bc4b495c56518a9a7ba1ff8208d6afcf85a10a9a6062c8f075c5e4a78d1","observation_id":"7479da98-217e-44fa-a73a-b5e9b42c56b1","resolution":{"observed_at":"2026-05-13T13:02:49.748374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal content alignment with llm for visual presentation of papers","venue":null,"work_id":"49d487e7-3ca2-47a4-ba3a-4c46dbba49c5","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:c956c1c4080be11925f0b2b60c862da1e5899f5d39b200cf24483ec8f3b76311","observation_id":"073d4230-c1cc-4e16-9ade-febcb4b5aecb","resolution":{"observed_at":"2026-05-13T13:02:49.673644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21660","last_updated":"2025-08-31T00:34:05Z","snapshot_observed_at":"2026-07-06T21:31:44.786368Z","submitted_at":"2025-05-27T18:36:19Z","title":"PreGenie: An Agentic Framework for High-quality Visual Presentation Generation","version":2},"cited_work":{"arxiv_id":"2505.21660","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21660","snapshot_observed_at":"2026-07-02T13:16:58.286178Z","title":"Pregenie: An agentic framework for high-quality visual presentation generation","venue":null,"work_id":"d194d864-6082-40f8-9283-d7792b0a348c","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2505.21660","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:c45c811ddb8beeaaf63a4eb6a13831666949d097d8aec84708965e2c14343e5a","observation_id":"beb96f69-932c-425c-b445-7a1bdeb29323","resolution":{"observed_at":"2026-05-13T02:32:06.453852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.15253","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T14:15:47.512780Z","title":"Present- coach: Dual-agent presentation coaching through exemplars and interactive feedback","venue":null,"work_id":"c658ced1-8dd9-431c-b384-c9655f33b172","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:7431613eafeb4f2622a60e862df58a066ad286e3ebd73664cf3513e94c07615a","observation_id":"da205164-c5ba-401f-a8c7-a3238b697d56","resolution":{"observed_at":"2026-05-13T02:32:06.460526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":"2505.14683","doi":"10.48550/arxiv.2505.14683","metadata_source":"pith","pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-07-10T13:37:06.841769Z","title":"Emerging Properties in Unified Multimodal Pretraining","venue":"cs.CV","work_id":"e0cfd82c-f5d4-44fd-b531-ec73ab0a805b","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:cab10d16b7f92551ac5c90b698cba4baf184bfbb5e055f2f4697ff7b43c0d6a9","observation_id":"9ffebeec-3f56-426a-8cb1-7dddfbadebf8","resolution":{"observed_at":"2026-05-13T02:32:06.426637Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":"2408.12528","doi":"10.48550/arxiv.2408.12528","metadata_source":"pith","pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","venue":"cs.CV","work_id":"1393dc24-a6b2-44e1-b5d7-7009d1fa4811","year":2024},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:ef5338580e4eab1ae646c2a077e0bc5e259a55a8dad5eb30f4953b9e097e89ec","observation_id":"8c6ce789-a5c0-4e4a-889c-b4dc7ac5ed4b","resolution":{"observed_at":"2026-05-13T02:32:06.438819Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Showui: One vision-language-action model for gui visual agent","venue":null,"work_id":"2e523eed-21fc-4668-b9b1-f908d6df6247","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:a9d9dc3fecafcb13f84ba88fa646c68a97398e85412e8478b5d635633f2d0db6","observation_id":"248d91e6-138a-4823-9b10-dbb823043333","resolution":{"observed_at":"2026-05-13T13:02:49.743426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15091","last_updated":"2024-07-12T18:03:29Z","snapshot_observed_at":"2026-08-03T11:40:16.152962Z","submitted_at":"2023-09-26T17:36:26Z","title":"VideoDirectorGPT: Consistent Multi-scene Video Generation via LLM-Guided Planning","version":2},"cited_work":{"arxiv_id":"2309.15091","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.15091","snapshot_observed_at":"2026-07-04T14:59:55.973287Z","title":"Videodirectorgpt: Consistent multi-scene video generation via llm-guided planning","venue":null,"work_id":"386fe0af-d0c9-4b38-a690-55b83415dbe2","year":2023},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2309.15091","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:eac1ef7018a249c5fec660e2951f68251f146eacb81f52c05f5055fa193be53d","observation_id":"eb0ae429-ec71-4d5e-aea3-5c5c84b69a8e","resolution":{"observed_at":"2026-05-13T02:32:06.450743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videostudio: Generating consistent-content and multi-scene videos","venue":null,"work_id":"b2810075-c1a6-4992-a319-4ac585bc33ac","year":2024},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:74dd32b3f565968b04fa8a368646693a9b32ac39f277bc85ab04a31ea7738076","observation_id":"c1cd4cc8-e650-4584-975c-21b4dfa43538","resolution":{"observed_at":"2026-05-13T13:02:49.668443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17444","last_updated":"2024-05-04T19:28:10Z","snapshot_observed_at":"2026-07-06T16:25:38.571377Z","submitted_at":"2023-09-29T17:54:46Z","title":"LLM-grounded Video Diffusion Models","version":3},"cited_work":{"arxiv_id":"2309.17444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17444","snapshot_observed_at":"2026-07-04T16:39:57.572622Z","title":"LLM -grounded video diffusion models","venue":null,"work_id":"11e16a9e-29d3-4409-b6a2-0fd470cefd02","year":2023},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2309.17444","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:a374f4999801dea4c0eaec17330413c358ca27ea4ec777a37caef3f4a7d30070","observation_id":"4de520cb-cae8-439d-bf54-36ae52f0b2c4","resolution":{"observed_at":"2026-05-13T02:32:06.411311Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":24,"verified_fuzzy":15},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 3 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2605.11363."}