{"as_of":"2026-08-09T02:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:977f366d6caa8e35dfd13039c134989a1f11b1a13c24116fb434840bbb2282ac","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:14:21.141496Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:56:37.419836Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T13:47:57.492670Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15800","snapshot_observed_at":"2026-08-06T19:56:37.419836Z","title":"Interspatial attention for efficient 4d human video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04285","last_updated":"2025-07-06T07:58:36Z","snapshot_observed_at":"2026-08-08T15:18:25.500324Z","submitted_at":"2025-07-06T07:58:36Z","title":"SeqTex: Generate Mesh Textures in Video Sequence","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:56:37.419836Z"},"links":{"cited_paper":"/paper/2505.15800","citing_paper":"/paper/2507.04285"},"observation_digest":"sha256:ee81860ffb60fed567d54ee807302a2ed1eb7d76207f02da1c50c879ce17136b","observation_id":"75286c7c-d3dd-48ec-9ae6-27b5a5124065","resolution":{"observed_at":"2026-08-06T19:56:37.419836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"cited_work":{"arxiv_id":"2505.15800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15800","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interspatial attention for efficient 4d human video generation","venue":null,"work_id":"5bd417e2-aac6-4bda-8c71-351e75b7f1e2","year":2025},"citing_paper":{"arxiv_id":"2601.10632","last_updated":"2026-04-10T16:10:59Z","snapshot_observed_at":"2026-07-06T22:41:48.115083Z","submitted_at":"2026-01-15T17:52:29Z","title":"CoMoVi: Co-Generation of 3D Human Motions and Realistic Videos","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-16T13:43:26.460480Z"},"links":{"cited_paper":"/paper/2505.15800","citing_paper":"/paper/2601.10632"},"observation_digest":"sha256:fda6ad9d390893a0ff28405245c0edabb880a99bfa1757e493adbaa5d4c75bd0","observation_id":"dc25338d-09cd-418e-89cc-6ec6572503dc","resolution":{"observed_at":"2026-05-16T13:47:57.494183Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15800/citation-record","integrity":"/paper/2505.15800/integrity","json":"/paper/2505.15800/citation-record.json","paper":"/paper/2505.15800"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-08-07T15:14:20.881817Z","title":"arXiv:2404.02101 [cs.CV] Li Hu, Xin Gao, Peng Zhang, Ke Sun, Bang Zhang, and Liefeng Bo","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.881817Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:0b96bd1f11c53fdefeb9780756b3d580dbde70d90df041a4a3372f68828db870","observation_id":"b6239fae-ae38-4e93-a09d-33564c016c3a","resolution":{"observed_at":"2026-08-07T15:14:20.881817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.557412Z","title":"Johanna Karras, Aleksander Holynski, Ting-Chun Wang, and Ira Kemelmacher- Shlizerman","venue":null,"work_id":"4f7d2060-3179-4443-91c6-3e700751d2b6","year":2024},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.885990Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:cebf68f163cb610b9903ed19f420340a1ba870c5788f1111a8b9ea25ca3a8230","observation_id":"6cef821d-3a50-48ff-8fda-c0973c853a3b","resolution":{"observed_at":"2026-08-07T15:14:21.562225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.545232Z","title":null,"venue":null,"work_id":"846c61cf-dc92-4a12-bde8-917c9d3fed6c","year":2023},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.898138Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:cb6343c3b56aff55c92d7062f2fdb4809e71135bed64dd4f4713a3bf5ea75bec","observation_id":"9147cc3b-ffab-49af-891a-d47529084a5d","resolution":{"observed_at":"2026-08-07T15:14:21.549659Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T15:14:20.902286Z","title":"https://arxiv.org/abs/2412.03603 Jimmy Lei Ba, Jamie Ryan Kiros, and Geoffrey E Hinton","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.902286Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:d110fd650a4081fa1d823a6c94acdea0c359e70e92dbdccadfb3dcd7d0ce4d76","observation_id":"eab4921b-185b-4ee9-8c7f-7c0ea52dec20","resolution":{"observed_at":"2026-08-07T15:14:20.902286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:20.910446Z","title":"SIGGRAPH Asia) 36, 6 (2017), 194:1–194:17","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.910446Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:e7e7134f5d662d4b8498efa4946468568a1830590936702e591fa4c22914cfba","observation_id":"bf9465c4-d180-425e-91db-e2c1764a60d6","resolution":{"observed_at":"2026-08-07T15:14:20.910446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.515775Z","title":"ArXiv (Aug 2023)","venue":null,"work_id":"6ccf703c-2f4b-49df-9956-38af1561ed90","year":2023},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.914289Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:4279e7458b45def83996deaa8392bccda3eba54d4696db5a9445684eaf25a19f","observation_id":"e57f9b6f-a5c9-4e66-b3b7-f6f3af69fa05","resolution":{"observed_at":"2026-08-07T15:14:21.520249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17061","last_updated":"2024-03-14T17:58:14Z","snapshot_observed_at":"2026-07-06T16:53:58.875152Z","submitted_at":"2023-11-28T18:59:58Z","title":"HumanGaussian: Text-Driven 3D Human Generation with Gaussian Splatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17061","snapshot_observed_at":"2026-08-07T15:14:20.921921Z","title":"arXiv preprint arXiv:2311.17061 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.921921Z"},"links":{"cited_paper":"/paper/2311.17061","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:7b765d91a01d5d6dbdf2926b25032fdc65ac9c453221d0759f4ce3f9ef43b5da","observation_id":"e01e995b-08d6-4d1d-a720-eb807ca6d877","resolution":{"observed_at":"2026-08-07T15:14:20.921921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.494981Z","title":"https://lumalabs.ai/dream-machine","venue":null,"work_id":"f165b30d-3426-4e25-8818-49631c331d62","year":2025},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.926134Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:f2aaed24c96f7ae0e93776cea03e23842661722ce2f380d8bc29b85c9aa5450f","observation_id":"dec0274e-8fec-4b52-a36f-8c25f1e85185","resolution":{"observed_at":"2026-08-07T15:14:21.498687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-06T03:43:29.067278Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-08-07T15:14:20.930688Z","title":"arXiv preprint arXiv:2409.04410 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.930688Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:988a345194c7a71c5d7f418690885036078401f2659f9e3528d32edd70639d88","observation_id":"ee8e6a07-bc63-4621-a9a3-e1ad4c00bdc1","resolution":{"observed_at":"2026-08-07T15:14:20.930688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1411.1784","last_updated":"2014-11-06T22:33:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-11-06T22:33:22Z","title":"Conditional Generative Adversarial Nets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.1784","snapshot_observed_at":"2026-08-07T15:14:20.935571Z","title":"arXiv preprint arXiv:1411.1784 (2014)","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.935571Z"},"links":{"cited_paper":"/paper/1411.1784","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:2464b9083406a1d8cc1951e8c4d7e5fa2373101b3bd9804581590352d4094d28","observation_id":"09c62ae5-6dcc-4c4a-92b5-02c461370250","resolution":{"observed_at":"2026-08-07T15:14:20.935571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-07T15:14:20.940481Z","title":"arXiv preprint arXiv:2407.02371 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.940481Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:411482197b0ffaede530da7162a9ebcacace037ccf4b9feeb127d2ea1ed80cb8","observation_id":"5809b363-7172-42d8-862b-3d6148a14388","resolution":{"observed_at":"2026-08-07T15:14:20.940481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.482638Z","title":"https://openai.com/index/ video-generation-models-as-world-simulators/","venue":null,"work_id":"ad4a6a25-3917-4667-8bbc-706fa9d49baf","year":2024},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.944377Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:71d4ad0dcfed1c3f116e1f8fdd45fe7023184a51971846477ef22a40d98f7801","observation_id":"9c6009eb-cdc6-47f0-b11b-0f23f82f9598","resolution":{"observed_at":"2026-08-07T15:14:21.487517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T15:14:20.947641Z","title":"arXiv preprint arXiv:2408.00714 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.947641Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:0b5eaa35ad938d5d9a0ced31a0805d95ffeb8e733a7e3fa08d2a540dc7015432","observation_id":"d2b22999-146d-4c91-a893-31f0fe859468","resolution":{"observed_at":"2026-08-07T15:14:20.947641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.469089Z","title":"https://runwayml.com/","venue":null,"work_id":"c818b50d-20d5-47eb-80be-f2863cc49cd7","year":2025},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.952048Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:4bfabb12da424124a13d5c9a5364f234c68db2c006a0842744338e01de1def21","observation_id":"3601bd8d-0f34-4b88-8b5d-86c78aa4d5ac","resolution":{"observed_at":"2026-08-07T15:14:21.473424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17405","last_updated":"2024-09-23T20:52:01Z","snapshot_observed_at":"2026-07-06T18:20:44.070255Z","submitted_at":"2024-05-27T17:53:29Z","title":"Human4DiT: 360-degree Human Video Generation with 4D Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17405","snapshot_observed_at":"2026-08-07T15:14:20.956062Z","title":"arXiv preprint arXiv:2405.17405 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.956062Z"},"links":{"cited_paper":"/paper/2405.17405","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:66a59fa76017f6997bb683725400127ad66314d761a3e661071b19ad149eb8fa","observation_id":"07e229a5-1a13-417a-8382-a1bcef632100","resolution":{"observed_at":"2026-08-07T15:14:20.956062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10306","last_updated":"2024-12-11T02:55:31Z","snapshot_observed_at":"2026-08-07T06:22:46.243818Z","submitted_at":"2024-10-14T09:06:55Z","title":"Animate-X: Universal Character Image Animation with Enhanced Motion Representation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10306","snapshot_observed_at":"2026-08-07T15:14:20.968100Z","title":"arXiv preprint arXiv:2410.10306 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.968100Z"},"links":{"cited_paper":"/paper/2410.10306","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:8f37bcfd90fc0dda6bd07869633db0890275bc8b6fb07e779f8c79eff52594d2","observation_id":"6fdb87e1-6eb0-420c-8a9e-8d249d0901aa","resolution":{"observed_at":"2026-08-07T15:14:20.968100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.443147Z","title":"Advances in Neural Information Processing Systems (2023)","venue":null,"work_id":"1e2cbaf0-6d86-41f1-b20d-6cf6bc24be2b","year":2023},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.971824Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:5c33424f687c5083adb2bd7aec4053c5bee8cd7aaa0c018939199ec6c42cb993","observation_id":"11572eaa-aa6d-4df7-99e3-014009fc7496","resolution":{"observed_at":"2026-08-07T15:14:21.447826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.15069","last_updated":"2021-04-30T15:38:41Z","snapshot_observed_at":"2026-08-03T09:13:59.922714Z","submitted_at":"2021-04-30T15:38:41Z","title":"A Good Image Generator Is What You Need for High-Resolution Video Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.15069","snapshot_observed_at":"2026-08-07T15:14:20.975374Z","title":"arXiv preprint arXiv:2104.15069 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.975374Z"},"links":{"cited_paper":"/paper/2104.15069","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:695ea0991e7df0f28ee3ab1c7a4aa01ccaf0ad9c911ad0945ef2fd060e09b960","observation_id":"7935306d-5b7d-4b59-be41-76012901b0bb","resolution":{"observed_at":"2026-08-07T15:14:20.975374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.427238Z","title":"arxiv (2024)","venue":null,"work_id":"a1e42e36-fc70-44be-8f75-46e62338d108","year":2024},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.979462Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:496c31aa6b41240aaabdf04b4a5aba7555e83b144c5a047770b075571961c8b9","observation_id":"9ee5288e-e4bd-48eb-8abb-f3abd9eb837f","resolution":{"observed_at":"2026-08-07T15:14:21.431666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-07-06T19:06:23.640089Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14837","snapshot_observed_at":"2026-08-07T15:14:20.987951Z","title":"arXiv:2408.14837 [cs.LG] https://arxiv.org/ abs/2408.14837 Aaron Van Den Oord, Oriol Vinyals, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.987951Z"},"links":{"cited_paper":"/paper/2408.14837","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:f514bb1b92e064616425382b1f543496c0ff3df5e5cc32950a143c1e21494d4a","observation_id":"4ff4a29b-f449-4a04-b54e-3eab52d80162","resolution":{"observed_at":"2026-08-07T15:14:20.987951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.399174Z","title":"Advances in neural information processing systems 30 (2017)","venue":null,"work_id":"0c4d051b-2a53-42b3-81dc-0da46061dc62","year":2017},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.992915Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:ac0f378f0d98e5745169ec086fb20c90c06aca1655b141808bbf780fa55d98ff","observation_id":"fa7034db-14b8-4b3f-9916-1eed14ebefa9","resolution":{"observed_at":"2026-08-07T15:14:21.403774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.385766Z","title":"Ruben Villegas, Mohammad Babaeizadeh, Pieter-Jan Kindermans, Hernan Moraldo, Han Zhang, Mohammad Taghi Saffar, Santiago Castro, Julius Kunze, and Dumitru Erhan","venue":null,"work_id":"fff93c2c-cd1e-46fb-9b01-b6f95d113241","year":2017},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.996944Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:19da2e7f2f804edf104b1c4480174a5237667d98e76a3a4b218d2987c9c72990","observation_id":"1143eb30-379d-4fde-8f4d-8c5007beab39","resolution":{"observed_at":"2026-08-07T15:14:21.390527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T15:14:21.116346Z","title":"arXiv preprint arXiv:2503.20314 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:21.116346Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:249f3a64393684bad8039b6a3d23c3e8468a04e3d3d9c1a1428f460c2e4a955c","observation_id":"d8dffc06-6e27-4d6d-8639-5578b7b264c9","resolution":{"observed_at":"2026-08-07T15:14:21.116346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08260","last_updated":"2025-04-26T17:58:24Z","snapshot_observed_at":"2026-08-01T11:16:30.883699Z","submitted_at":"2024-10-10T17:57:49Z","title":"Koala-36M: A Large-scale Video Dataset Improving Consistency between Fine-grained Conditions and Video Content","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08260","snapshot_observed_at":"2026-08-07T15:14:21.120530Z","title":"arXiv preprint arXiv:2410.08260 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:21.120530Z"},"links":{"cited_paper":"/paper/2410.08260","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:95aeb2cda54db674b69f0dea30fdaf5db5f3e4c51cab1b2aaaf953a50074f00e","observation_id":"b790cc10-4fcf-4fb9-86a1-097a7c700402","resolution":{"observed_at":"2026-08-07T15:14:21.120530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.373453Z","title":"arXiv e-prints (2023), arXiv–2307","venue":null,"work_id":"704f1f8d-6746-4f52-a08a-fcc5d4d259c0","year":2023},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:21.125191Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:b2dc95a74e4a94c4252f929034801425786602a4378fc619aaea941ad14e9881","observation_id":"7f315fbe-7e58-4ee5-9c28-fff435321da8","resolution":{"observed_at":"2026-08-07T15:14:21.378126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-07-06T11:02:11.424356Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-07T15:14:21.128538Z","title":"arXiv preprint arXiv:2104.10157 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:21.128538Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:2e8ccc48160bc9cad5be26012461ae1eca6b7af90f5e3f52b25bdadbf94c3399","observation_id":"c3cc951e-8f7d-4f3c-96d8-4d41af75e8cd","resolution":{"observed_at":"2026-08-07T15:14:21.128538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-07-06T11:56:10.689708Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-07T15:14:21.132572Z","title":"arXiv preprint arXiv:2110.04627 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:21.132572Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:3d6b6ffabab9a951f85780275619656e4732b623fb154dabb2f5e5f92c088cd1","observation_id":"8c7ef8fe-4417-4cfc-adc0-953ea8ef0bf8","resolution":{"observed_at":"2026-08-07T15:14:21.132572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20279","last_updated":"2024-10-23T02:38:44Z","snapshot_observed_at":"2026-07-06T18:22:53.072592Z","submitted_at":"2024-05-30T17:33:10Z","title":"CV-VAE: A Compatible Video VAE for Latent Generative Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20279","snapshot_observed_at":"2026-08-07T15:14:21.136900Z","title":"https://arxiv.org/abs/2405.20279 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:21.136900Z"},"links":{"cited_paper":"/paper/2405.20279","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:e6abd76e6c2827e3818316289b8bec2b9ccd427fe57ef360b19501c5807840b1","observation_id":"99ab9c85-0178-4c01-9f02-1f10d5ed141b","resolution":{"observed_at":"2026-08-07T15:14:21.136900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.359666Z","title":"https://github.com/hpcaitech/Open-Sora Zerong Zheng, Xiaochen Zhao, Hongwen Zhang, Boning Liu, and Yebin Liu","venue":null,"work_id":"6e8b5571-e680-42a3-935c-caa1f08c3c91","year":2023},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:21.141496Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:1310ab916a3c5c9d25436cc9bfb45ead7c624fefb8b6eb490c776d03e7718c7d","observation_id":"b4aa259f-5456-4da3-b4b0-2780deeb3d5c","resolution":{"observed_at":"2026-08-07T15:14:21.365377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.455793Z","title":null,"venue":null,"work_id":"ddf02ac0-bc50-4d5e-9e03-cac574221546","year":2019},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":1171,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.959701Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:c9fb509209c619960ecfbbcd1338a16a21a07c8393547599f6fb5ace11b82b02","observation_id":"97c9b1c0-9454-4ebc-94e7-c7d16af60fdd","resolution":{"observed_at":"2026-08-07T15:14:21.461037Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-07T15:14:20.894090Z","title":"arXiv preprint arXiv:1312.6114 (2013)","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.894090Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:59331196ee841f61c9895fe40e986103c5eb9ad5ea13016966a43e86c3b0d4f0","observation_id":"7c5793d6-f42f-44c8-8e93-658695e968a5","resolution":{"observed_at":"2026-08-07T15:14:20.894090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.569996Z","title":"Advances in neural information processing systems 27 (2014)","venue":null,"work_id":"b48ec2c5-dba2-4f37-8879-dbb01854e468","year":2014},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.873064Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:fe10a4b8b5c2645a20153168627c3fe3492453a859147903ee3b971bf4a02f0b","observation_id":"3ae10458-c167-4302-8de3-4b05b2884e4d","resolution":{"observed_at":"2026-08-07T15:14:21.574832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.532143Z","title":"ArXiv e-prints (2016), arXiv–1607","venue":null,"work_id":"c79a5e34-f2de-4cc9-b387-72008ef8fe03","year":2016},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.907044Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:612d35af2badf1ebe3ba11a813f611f2a9f44f3fcecb2002da681c9197e8d49c","observation_id":"cd70aa4b-2bc8-4378-be0f-f85723300b97","resolution":{"observed_at":"2026-08-07T15:14:21.538398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-07T15:14:20.889980Z","title":"arXiv preprint arXiv:1705.06950 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.889980Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:79bc388fa443c55ce4c8e15bb6f555085da23d80510bba94a7b8d5e64bfdbcc5","observation_id":"9a5a089e-9c7c-458f-939d-a465f6299439","resolution":{"observed_at":"2026-08-07T15:14:20.889980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.414219Z","title":null,"venue":null,"work_id":"b0634c5e-eaf2-4d7b-94a0-e2484fa6baf0","year":2019},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.983697Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:9c1d5be1956990544faf19ed6af6ee068cd50523c1fc062bb82c59429fb863aa","observation_id":"4c9eebb3-2e05-4cee-b54f-b2e4ae6bd589","resolution":{"observed_at":"2026-08-07T15:14:21.418927Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T15:14:20.964178Z","title":"arXiv:2010.02502 (October 2020)","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.964178Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:c046f0b65ec12b44e0359d5fbf2e0c006708035ad20d863ed6aadf77e13dc351","observation_id":"435fbdb8-026c-4d93-b412-334287693bfa","resolution":{"observed_at":"2026-08-07T15:14:20.964178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.505084Z","title":"ACM transactions on graphics (TOG) 40, 6 (2021), 1–16","venue":null,"work_id":"0c40757d-16a9-4e46-9d4c-2a198731e185","year":2021},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.918554Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:c607bb774c53c0790ed5a0729bae86a295b49686e267891a092c8f380f719f8d","observation_id":"d768f3de-edf5-46d0-90a1-4a6f61b30005","resolution":{"observed_at":"2026-08-07T15:14:21.508866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.593240Z","title":"Advances in Neural Information Processing Systems 35 (2022), 19900–19916","venue":null,"work_id":"cdfca219-6e0c-49f8-be1d-4a3263d348dd","year":2022},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.864873Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:330f08ae0ebcd9f7c7bd5853d3075f050c87e69a42dddb0f4be58c87ca794960","observation_id":"a2b10016-b3d5-4808-aaa5-db964be69dfe","resolution":{"observed_at":"2026-08-07T15:14:21.596816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06662","last_updated":"2023-12-11T18:59:57Z","snapshot_observed_at":"2026-08-07T19:06:02.627634Z","submitted_at":"2023-12-11T18:59:57Z","title":"Photorealistic Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06662","snapshot_observed_at":"2026-08-07T15:14:20.876919Z","title":"arXiv preprint arXiv:2312.06662 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.876919Z"},"links":{"cited_paper":"/paper/2312.06662","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:495dab4226fb08f2548d5784b16ce46677f3ef44c883b26d8adadb2aebaea8db","observation_id":"61bf796b-3e09-4c2e-87b7-cc8273bb1b61","resolution":{"observed_at":"2026-08-07T15:14:20.876919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.581848Z","title":"In Forty-first International Conference on Machine Learning, ICML 2024, Vienna, Austria, July 21-27,","venue":null,"work_id":"da9c628b-40f9-4518-ad5f-a8e9b78ef445","year":2024},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.869424Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:004d8efd383715431c67288734b3508d29918860c80f193113cfa71cb5a9092e","observation_id":"be854e3e-7591-4e3c-9919-f709ff0aad51","resolution":{"observed_at":"2026-08-07T15:14:21.586535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-07T15:14:20.861002Z","title":"arXiv preprint arXiv:2501.03575 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.861002Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:e2d0d66046606ac8d20a58dc9a6b3721c249e55f86b1b6525fe0605a7e24a050","observation_id":"e75c1a73-b4f3-4a38-878b-ce2f6d7f4a94","resolution":{"observed_at":"2026-08-07T15:14:20.861002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T15:17:56.049384Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 2 inbound Pith citation observations for arXiv:2505.15800."}