{"as_of":"2026-08-19T11:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0fc572b8db7f97537f82a004da9a507255c485d1ba0782b19175a3c106586211","coverage":[{"denominator":111,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:40:20.184805Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:34:44.785950Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-10T22:25:27.572440Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"cited_work":{"arxiv_id":"2412.10783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.10783","snapshot_observed_at":"2026-08-10T22:25:27.572440Z","title":"Video Diffusion Transformers are In-Context Learners","venue":"cs.CV","work_id":"8e1fc4ef-36c5-411f-a195-407d24bcde08","year":2024},"citing_paper":{"arxiv_id":"2501.01790","last_updated":"2025-03-18T10:47:27Z","snapshot_observed_at":"2026-08-17T11:20:56.165062Z","submitted_at":"2025-01-03T12:45:22Z","title":"Ingredients: Blending Custom Photos with Video Diffusion Transformers","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:25.580466Z"},"links":{"cited_paper":"/paper/2412.10783","citing_paper":"/paper/2501.01790"},"observation_digest":"sha256:987cc52f5a72ba0d293ff8d6aeea91006d10691645241ff9c90f96ed74ae2cb4","observation_id":"3b195bde-8c54-47c7-97c0-eb2a18f64425","resolution":{"observed_at":"2026-08-10T22:25:27.581607Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10783","snapshot_observed_at":"2026-08-03T20:30:28.157199Z","title":"Video diffusion transformers are in-context learners.arXiv preprint arXiv:2412.10783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:28.157199Z"},"links":{"cited_paper":"/paper/2412.10783","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:c390721f25614c25d665f7138b31b64165626d9e08293a56554bbe9623582855","observation_id":"ed0d0cab-40ff-4c6f-ab86-bf5d9103ce55","resolution":{"observed_at":"2026-08-03T20:30:28.157199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10783","snapshot_observed_at":"2026-08-16T00:34:44.785950Z","title":"Video diffusion transform- ers are in-context learners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.785950Z"},"links":{"cited_paper":"/paper/2412.10783","citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:3f49e5d6771d99e4a8de2c60d8c0cce242d5382d8a9eb0df215468941270bd58","observation_id":"ea42b9c8-20c1-4395-a209-de4a99b83469","resolution":{"observed_at":"2026-08-16T00:34:44.785950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.10783/citation-record","integrity":"/paper/2412.10783/integrity","json":"/paper/2412.10783/citation-record.json","paper":"/paper/2412.10783"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:19.635053Z","title":"All are worth words: A vit backbone for diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.635053Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:a73adcd6525923d6f8cd79448b02e6d490979f9b81e499d5a2e29e0b3fb78990","observation_id":"df516353-8b38-448b-bb77-75dc42ad6061","resolution":{"observed_at":"2026-08-11T15:40:19.635053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00353","last_updated":"2023-11-01T08:02:57Z","snapshot_observed_at":"2026-08-16T14:46:57.446294Z","submitted_at":"2023-11-01T08:02:57Z","title":"LatentWarp: Consistent Diffusion Latents for Zero-Shot Video-to-Video Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00353","snapshot_observed_at":"2026-08-11T15:40:19.641163Z","title":"Latentwarp: Consistent diffusion latents for zero-shot video-to-video translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.641163Z"},"links":{"cited_paper":"/paper/2311.00353","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:573a3ee0799a59f76e201f232114d0379e51730def4b5b9c48225b6f673dfeb7","observation_id":"b5721a23-8a25-4756-a88a-252a2cddc35e","resolution":{"observed_at":"2026-08-11T15:40:19.641163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T15:40:19.646865Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.646865Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:1f25c02102822e3be248157e52fdf12529dfaaf9727971795d08327a93a91e4e","observation_id":"39c9f385-7793-4fe8-b89a-38c9cdb48665","resolution":{"observed_at":"2026-08-11T15:40:19.646865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:19.652389Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.652389Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:0afb3bb66a416285057bd4ae7d1cc4dceaac7ca867a1d520889a4a83f8ed9a75","observation_id":"4214ad67-5436-41d8-b120-98a0bc21505a","resolution":{"observed_at":"2026-08-11T15:40:19.652389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-11T15:40:19.657686Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.657686Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:82d8f68b4f3225098acf7ffedf45dee4210d29e51dcbbadfbe14ab3b1224d7f7","observation_id":"c0474b52-7601-4ff3-aee3-667722e043fb","resolution":{"observed_at":"2026-08-11T15:40:19.657686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:19.663139Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.663139Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:5caf2dd0301f01bfc0ed046b80ee7d5d11867dfffcf6d18d9ad1eae787a0dedd","observation_id":"78f8e4c9-4dbf-42bb-9635-130797b3cc0e","resolution":{"observed_at":"2026-08-11T15:40:19.663139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-11T15:40:19.669022Z","title":"Pixart-a: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.669022Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:0a6ec83e7e0f60446edaf8d5029b4464d50591badd0cac9b856d1cfa2fc25c22","observation_id":"a591a4e3-f5d8-4806-afa7-f7ea8ba55713","resolution":{"observed_at":"2026-08-11T15:40:19.669022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:19.674419Z","title":"Seine: Short-to-long video diffusion model for generative transition and prediction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.674419Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:04f31a09e02216f72526307067b1bf92e5e64db886cc3f8d6e9f3271d72c23d5","observation_id":"7906ac26-21f7-4c7c-b41c-0397b13a86ab","resolution":{"observed_at":"2026-08-11T15:40:19.674419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06571","last_updated":"2019-09-25T16:37:55Z","snapshot_observed_at":"2026-08-15T04:08:33.157509Z","submitted_at":"2019-07-15T16:27:04Z","title":"Adversarial Video Generation on Complex Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06571","snapshot_observed_at":"2026-08-11T15:40:19.679097Z","title":"Adversarial video generation on complex datasets","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.679097Z"},"links":{"cited_paper":"/paper/1907.06571","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:67346dee019525dd0510800d4246d7786ffcb36c11faab236e1c1967354d9bf4","observation_id":"f7b2f696-fc0d-492e-ac2d-9b93a5891f94","resolution":{"observed_at":"2026-08-11T15:40:19.679097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00234","last_updated":"2024-10-05T11:47:02Z","snapshot_observed_at":"2026-07-06T14:36:25.690733Z","submitted_at":"2022-12-31T15:57:09Z","title":"A Survey on In-context Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00234","snapshot_observed_at":"2026-08-11T15:40:19.684635Z","title":"A survey on in-context learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.684635Z"},"links":{"cited_paper":"/paper/2301.00234","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:ca234ff9db77c2b6b1fa4eef5bbba1509b36c899b7125d8918703af3188176ca","observation_id":"bf002f81-5853-4e0a-a5c4-622c955c1daf","resolution":{"observed_at":"2026-08-11T15:40:19.684635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T15:40:19.689881Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.689881Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:4eebc1e5012ead7201af1181e605d5dd1d1b8aec81b70c96cee3afc56bf5d844","observation_id":"ec81b35b-563f-4ac8-bf3e-50267266e727","resolution":{"observed_at":"2026-08-11T15:40:19.689881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:19.694948Z","title":"Scaling rectified flow transform- ers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.694948Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:0afb78dee4b651bc45f718da64b94dbf49f9152790a8950d129563e53b5debf6","observation_id":"85092cd7-a4cc-4500-a4c9-766ab1a3568d","resolution":{"observed_at":"2026-08-11T15:40:19.694948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:19.699796Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.699796Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:c2a13e1bbe36fee28ac3f6986b4e6eef15a682cb7c1173ec27de19ba43ec0e4a","observation_id":"d44767c6-4ac6-4720-99d5-29fe249c2e36","resolution":{"observed_at":"2026-08-11T15:40:19.699796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14358","last_updated":"2024-07-31T16:22:42Z","snapshot_observed_at":"2026-08-16T13:32:41.679971Z","submitted_at":"2024-07-19T14:40:23Z","title":"Stable Audio Open","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14358","snapshot_observed_at":"2026-08-11T15:40:19.704569Z","title":"Stable audio open","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.704569Z"},"links":{"cited_paper":"/paper/2407.14358","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:630f09904530a92fb2b631ff62ec901503aff97cd4fc989dbdba5dd0b9719de1","observation_id":"a0ae5ba6-8300-4f4d-b6fb-5a9e9469d1dd","resolution":{"observed_at":"2026-08-11T15:40:19.704569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:19.709507Z","title":"Motioncharacter: Identity- preserving and motion controllable human video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.709507Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:adbbde54675b8fdfab441ff4bb8cadfe0b7cf50ec761bcfe74fc46d8773851fe","observation_id":"5a4e82a7-08df-4cc9-9209-44d59d2a8579","resolution":{"observed_at":"2026-08-11T15:40:19.709507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06365","last_updated":"2019-12-13T09:06:46Z","snapshot_observed_at":"2026-08-18T01:12:58.701646Z","submitted_at":"2019-12-13T09:06:46Z","title":"Fast Image Caption Generation with Position Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06365","snapshot_observed_at":"2026-08-11T15:40:19.714326Z","title":"Fast image caption generation with position alignment","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.714326Z"},"links":{"cited_paper":"/paper/1912.06365","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:9a6dadf21a7c31f7a2ebae9b3ffc7324f417561118e30fe65e9667eb527bd0f6","observation_id":"2aaa000f-d6f8-465c-ac06-a0341f061851","resolution":{"observed_at":"2026-08-11T15:40:19.714326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:19.719378Z","title":"Partially non-autoregressive image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.719378Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:50d5d01f204da02200d1892548698ed2c0225ba3c5a3917d894cf0dc6a259304","observation_id":"278fce09-db7f-425b-b2ee-9ad43b492ddd","resolution":{"observed_at":"2026-08-11T15:40:19.719378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15830","last_updated":"2024-01-11T13:16:43Z","snapshot_observed_at":"2026-08-16T14:40:03.688361Z","submitted_at":"2023-11-27T13:53:53Z","title":"A-JEPA: Joint-Embedding Predictive Architecture Can Listen","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15830","snapshot_observed_at":"2026-08-11T15:40:19.724388Z","title":"A-jepa: Joint-embedding predictive architecture can listen","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.724388Z"},"links":{"cited_paper":"/paper/2311.15830","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:fb3abc1d5f2541d42a15f91e83701177cf570dd2f55443bf1684c2051bc7c4c5","observation_id":"023e501f-7cd6-4341-bcd1-f7d7e4cc8a23","resolution":{"observed_at":"2026-08-11T15:40:19.724388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:19.729569Z","title":"Gradient-free textual inversion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.729569Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:1bcda6b3b22cdf14328545dc1c4b1f3c401892e8eb252c11f642e7a0b02ff15a","observation_id":"1f4156a2-6c0d-48f0-93b0-88d1e907f563","resolution":{"observed_at":"2026-08-11T15:40:19.729569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13358","last_updated":"2024-04-20T11:52:30Z","snapshot_observed_at":"2026-08-16T13:59:16.535626Z","submitted_at":"2024-04-20T11:52:30Z","title":"Music Consistency Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13358","snapshot_observed_at":"2026-08-11T15:40:19.734960Z","title":"Music consistency models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.734960Z"},"links":{"cited_paper":"/paper/2404.13358","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:be52907aa014e8cdc3d9c728f6028c771694ea8d6ca4b15cd8b7e941ac7aa7b1","observation_id":"f5d87e7c-0302-48c2-8555-8e73365f504a","resolution":{"observed_at":"2026-08-11T15:40:19.734960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00587","last_updated":"2024-12-20T11:22:01Z","snapshot_observed_at":"2026-08-16T13:22:22.991987Z","submitted_at":"2024-09-01T02:43:33Z","title":"FLUX that Plays Music","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00587","snapshot_observed_at":"2026-08-11T15:40:19.740228Z","title":"Flux that plays music","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.740228Z"},"links":{"cited_paper":"/paper/2409.00587","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:c0117d9c5b3110db3f830ad308c3307a697937c15adb090e850849fb13589eba","observation_id":"94ef7702-669e-4c6c-9e80-511acb3ea22c","resolution":{"observed_at":"2026-08-11T15:40:19.740228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05608","last_updated":"2024-03-28T08:28:44Z","snapshot_observed_at":"2026-08-16T14:20:16.327929Z","submitted_at":"2024-02-08T12:08:42Z","title":"Scalable Diffusion Models with State Space Backbone","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05608","snapshot_observed_at":"2026-08-11T15:40:19.745469Z","title":"Scalable diffusion models with state space backbone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.745469Z"},"links":{"cited_paper":"/paper/2402.05608","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:60cd79957b30c5edac6ef47f43b5b709fa78b65cb527d3a7b3105599bb5a6a85","observation_id":"810582bd-2f29-484f-88d4-2820193e5a48","resolution":{"observed_at":"2026-08-11T15:40:19.745469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04478","last_updated":"2024-04-06T02:54:35Z","snapshot_observed_at":"2026-08-16T14:03:12.578100Z","submitted_at":"2024-04-06T02:54:35Z","title":"Diffusion-RWKV: Scaling RWKV-Like Architectures for Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04478","snapshot_observed_at":"2026-08-11T15:40:19.750605Z","title":"Diffusion-rwkv: Scaling rwkv-like architectures for diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.750605Z"},"links":{"cited_paper":"/paper/2404.04478","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:f6213d6394cd89ff77a06d66f2fa08eba0599d3e28826391bb44f75c0ba47e91","observation_id":"30639231-2dc9-415e-9a3a-90e553dcfe31","resolution":{"observed_at":"2026-08-11T15:40:19.750605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11633","last_updated":"2024-09-09T02:17:12Z","snapshot_observed_at":"2026-08-16T13:33:48.508986Z","submitted_at":"2024-07-16T11:55:23Z","title":"Scaling Diffusion Transformers to 16 Billion Parameters","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11633","snapshot_observed_at":"2026-08-11T15:40:19.755839Z","title":"Scaling diffusion transformers to 16 billion parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.755839Z"},"links":{"cited_paper":"/paper/2407.11633","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:475ffb57550f7a2bd6de7b7d4c39d8d8fc81404f115ba8db9bf35f2a0f116376","observation_id":"a44c58d3-54e9-41c7-b26a-b0acff7cb46d","resolution":{"observed_at":"2026-08-11T15:40:19.755839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01159","last_updated":"2024-06-03T09:51:59Z","snapshot_observed_at":"2026-08-16T13:46:49.329986Z","submitted_at":"2024-06-03T09:51:59Z","title":"Dimba: Transformer-Mamba Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01159","snapshot_observed_at":"2026-08-11T15:40:19.761103Z","title":"Dimba: Transformer-mamba diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.761103Z"},"links":{"cited_paper":"/paper/2406.01159","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:9f1fa6d92e83aecd61895d340ac00e1e50625c9efbff75e199270dbd5efec1f7","observation_id":"5e50a9c7-566d-4ff8-be67-05236ea380f2","resolution":{"observed_at":"2026-08-11T15:40:19.761103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02291","last_updated":"2023-09-20T06:55:27Z","snapshot_observed_at":"2026-08-16T16:26:42.940705Z","submitted_at":"2022-10-05T14:27:20Z","title":"Progressive Text-to-Image Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02291","snapshot_observed_at":"2026-08-11T15:40:19.766441Z","title":"Progressive text-to-image genera- tion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.766441Z"},"links":{"cited_paper":"/paper/2210.02291","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:78b1794cd6c5721e2400a17746e2ca102a8044a1b25337e9be01280cf6add0e5","observation_id":"ef893ee3-7034-47d7-9950-38b2cb1a957a","resolution":{"observed_at":"2026-08-11T15:40:19.766441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:19.771771Z","title":"Masked auto-encoders meet generative adversarial networks and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.771771Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:2a5799e93761611afc798507b4b459a50970fbe9d902f8ccea026672ac9543b9","observation_id":"81edbeb9-d745-4065-9fab-eb8cb75be443","resolution":{"observed_at":"2026-08-11T15:40:19.771771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01790","last_updated":"2025-03-18T10:47:27Z","snapshot_observed_at":"2026-08-17T11:20:56.165062Z","submitted_at":"2025-01-03T12:45:22Z","title":"Ingredients: Blending Custom Photos with Video Diffusion Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01790","snapshot_observed_at":"2026-08-11T15:40:19.776786Z","title":"Ingredients: Blending custom photos with video diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.776786Z"},"links":{"cited_paper":"/paper/2501.01790","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:7c3af5676fcdf3bf859a64ee21352965d9ed7352653e1fadb2ba17e3c69f99f2","observation_id":"ef1f1ffd-9425-4b4e-b090-ce610b0dc933","resolution":{"observed_at":"2026-08-11T15:40:19.776786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:19.782139Z","title":"Deecap: Dynamic early exiting for efficient image captioning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.782139Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:2de477f36260fc4afb0f34531146733acf1114f04268751e8d90ecb1d3d63b74","observation_id":"b7cfabdc-c88b-49c0-8fb5-facd0519b68d","resolution":{"observed_at":"2026-08-11T15:40:19.782139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06525","last_updated":"2025-02-28T06:40:38Z","snapshot_observed_at":"2026-08-17T23:53:04.160559Z","submitted_at":"2024-11-10T16:59:39Z","title":"I2VControl-Camera: Precise Video Camera Control with Adjustable Motion Strength","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06525","snapshot_observed_at":"2026-08-11T15:40:19.787193Z","title":"I2vcontrol-camera: Precise video camera control with adjustable motion strength","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.787193Z"},"links":{"cited_paper":"/paper/2411.06525","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:c33bf13e68df7730b4be52c9e4513ac70f5ba53cfc326cade81667f5ed041a57","observation_id":"6db81a31-98dc-4f48-8d09-ecce494f230e","resolution":{"observed_at":"2026-08-11T15:40:19.787193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-11T15:40:19.792563Z","title":"An image is worth one word: Personalizing text-to-image generation using textual inversion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.792563Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:e087cc65c232ce4d8641c89223774259a064598788b611cffd83f60e6b99e2cd","observation_id":"dec00dce-c7da-4fcc-b437-011fb662f956","resolution":{"observed_at":"2026-08-11T15:40:19.792563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-08-16T13:53:57.994391Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-11T15:40:19.798497Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.798497Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:8e757468883c937638512e4eccfb2ad36a8011aad34efd8e89965bf03ee80a27","observation_id":"60c5fffb-27ba-46fc-ba1a-9f59906940ed","resolution":{"observed_at":"2026-08-11T15:40:19.798497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:19.804073Z","title":"The unreasonable effectiveness of few-shot learning for machine translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.804073Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:a9d0c4ebc6c97af5d9f5070576c5797b43650951b090bd43de3ca284707d0d9c","observation_id":"97f0497a-402d-4c67-b6b0-49014d72adc0","resolution":{"observed_at":"2026-08-11T15:40:19.804073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-18T16:04:08.688802Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-11T15:40:19.814698Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.814698Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:33bb22e39121f6b1c44df12ae28b63238550a5791e9c487618f9893742769736","observation_id":"9c3d6d94-b945-458c-b211-343982de1c5e","resolution":{"observed_at":"2026-08-11T15:40:19.814698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:19.820483Z","title":"Vector quantized diffusion model for text-to-image synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.820483Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:46c23b51175fbe84c3a9ea15ca2b2d04220c2d44ddde91ac465d317caf1a8d05","observation_id":"f279d4a0-cad4-437a-86ef-763b147b5f75","resolution":{"observed_at":"2026-08-11T15:40:19.820483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-08-16T17:39:09.604516Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-08-11T15:40:19.825814Z","title":"Cameractrl: Enabling camera control for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.825814Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:2d415e3908097cfc702f77da4ce1d89baa05f252535113f0ee77dd7160a72a99","observation_id":"20bb7940-050c-409e-8240-2a2f7ab8b0d4","resolution":{"observed_at":"2026-08-11T15:40:19.825814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:19.831153Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.831153Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:7213c6cb9f603b5c53e06107935bc57df6d98a7899a674e669be7e06d44da35a","observation_id":"ecbc1d73-dac0-4707-9129-ccc726984f2d","resolution":{"observed_at":"2026-08-11T15:40:19.831153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-17T16:16:01.560363Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-11T15:40:19.835947Z","title":"Latent video diffusion models for high-fidelity video generation with arbitrary lengths","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.835947Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:1956ce1f468aa22e068bd544f076d4b54e819158eb97471a7dc5c54bd66cd640","observation_id":"14db66ce-19a2-4fb2-bcb7-2e18f0f97ad5","resolution":{"observed_at":"2026-08-11T15:40:19.835947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14773","last_updated":"2025-04-16T13:38:58Z","snapshot_observed_at":"2026-08-18T16:04:07.176253Z","submitted_at":"2024-03-21T18:27:29Z","title":"StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14773","snapshot_observed_at":"2026-08-11T15:40:19.841363Z","title":"Streamingt2v: Consistent, dynamic, and extendable long video generation from text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.841363Z"},"links":{"cited_paper":"/paper/2403.14773","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:28f4fb034afd9f8c920855ae9127188a40ce1efabb71b9790809a884c9387a9b","observation_id":"c4dca82c-3813-49b1-bff2-8101e3b86387","resolution":{"observed_at":"2026-08-11T15:40:19.841363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-08-18T00:41:06.039123Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-11T15:40:19.846704Z","title":"Imagen video: High definition video generation with diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.846704Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:226ac80de0fa57e44fdc5fac27c098483dd25e3bf65a115b68c899eba5cf24c2","observation_id":"adccf00f-d031-4ffb-b4ff-1a5cf11c78d8","resolution":{"observed_at":"2026-08-11T15:40:19.846704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:19.852327Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.852327Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:79c83758afb494740c9958bfbbe1f8bf8b801e78862441f071f1de94359a5235","observation_id":"b5f5c521-5dfe-494f-ba01-f36ee48c0c3d","resolution":{"observed_at":"2026-08-11T15:40:19.852327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-11T15:40:19.857283Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.857283Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:1f4dd76b068df110613e95958e636a05e8ecc5b72d9bb4feda0c594bd3c454de","observation_id":"f28e7520-f271-4732-87c7-b347c667cc14","resolution":{"observed_at":"2026-08-11T15:40:19.857283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T15:40:19.862321Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.862321Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:4b8cdf869278a2ecf91687fe89ebbb4d8a9d012ecdfafbe57fad5506c189c0c3","observation_id":"3fda646e-00e3-4950-a03a-ae226fb9f2d7","resolution":{"observed_at":"2026-08-11T15:40:19.862321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02095","last_updated":"2024-11-27T07:59:25Z","snapshot_observed_at":"2026-08-16T18:10:25.611057Z","submitted_at":"2024-09-03T17:52:03Z","title":"DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02095","snapshot_observed_at":"2026-08-11T15:40:19.867264Z","title":"Depthcrafter: Generating consistent long depth sequences for open-world videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.867264Z"},"links":{"cited_paper":"/paper/2409.02095","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:5649a0d5bad943b36beefe9ad8debe0e6cab76ebb12c5b98faa36e59fb9a5b62","observation_id":"ead37ca4-8608-4ed9-ad51-8bf89d698a0f","resolution":{"observed_at":"2026-08-11T15:40:19.867264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14073","last_updated":"2023-08-03T09:34:24Z","snapshot_observed_at":"2026-08-16T15:13:10.800063Z","submitted_at":"2023-07-26T09:50:44Z","title":"VideoControlNet: A Motion-Guided Video-to-Video Translation Framework by Using Diffusion Model with ControlNet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14073","snapshot_observed_at":"2026-08-11T15:40:19.872352Z","title":"Videocontrolnet: A motion-guided video-to-video translation framework by using diffusion model with controlnet","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.872352Z"},"links":{"cited_paper":"/paper/2307.14073","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:c35f15e95945d03d5538d195c22cd80407ca855a38b0ed781a2c571187503cff","observation_id":"b8a731d4-7d01-49e0-b1ce-fc465856f0d9","resolution":{"observed_at":"2026-08-11T15:40:19.872352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23775","last_updated":"2024-11-05T06:41:27Z","snapshot_observed_at":"2026-08-17T23:31:59.305347Z","submitted_at":"2024-10-31T09:45:00Z","title":"In-Context LoRA for Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23775","snapshot_observed_at":"2026-08-11T15:40:19.877452Z","title":"In-context lora for diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.877452Z"},"links":{"cited_paper":"/paper/2410.23775","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:7981640d03ebe47b82976d8766379e8704591b2eba0823ce7bce98800e73d122","observation_id":"24d85853-4654-4459-8b91-95cc6c1e34eb","resolution":{"observed_at":"2026-08-11T15:40:19.877452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07987","last_updated":"2024-07-25T09:33:50Z","snapshot_observed_at":"2026-08-06T11:02:06.607024Z","submitted_at":"2024-05-13T17:58:30Z","title":"The Platonic Representation Hypothesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07987","snapshot_observed_at":"2026-08-11T15:40:19.882761Z","title":"The platonic representation hypothesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.882761Z"},"links":{"cited_paper":"/paper/2405.07987","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:fad2ded3c44c06642ec15327292747c2c32b585b125a09c51556cfff04766c12","observation_id":"43aa58fa-c530-4a8e-80a5-c2a14999d1d5","resolution":{"observed_at":"2026-08-11T15:40:19.882761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:19.887858Z","title":"Panoptic segmentation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.887858Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:aaac1523e497434d43ae19131840afeddd9d7c323ffb0724c099204d68b74829","observation_id":"ec5b00a5-8f49-4cc4-82f5-5b6abb5bce10","resolution":{"observed_at":"2026-08-11T15:40:19.887858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-08-14T12:12:01.418974Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-11T15:40:19.892921Z","title":"Videopoet: A large language model for zero-shot video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.892921Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:5a0d41b6266a7cd54a7200e6292205d3aa025f57c8a80449d644e529c6baaed3","observation_id":"fa196681-f38d-486b-acd6-8e477be472a3","resolution":{"observed_at":"2026-08-11T15:40:19.892921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:19.898070Z","title":"Controlnet ++ : Improving conditional controls with efficient consistency feedback","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.898070Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:a79aef954380a8616227f3f39adc6ceca45f1b633cd114d621180b030c399d54","observation_id":"6a9fbc2c-9b6f-4bef-aa15-46ec3e60883c","resolution":{"observed_at":"2026-08-11T15:40:19.898070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01750","last_updated":"2023-05-04T14:50:38Z","snapshot_observed_at":"2026-08-16T15:36:09.128340Z","submitted_at":"2023-05-02T19:31:55Z","title":"Few-shot In-context Learning for Knowledge Base Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01750","snapshot_observed_at":"2026-08-11T15:40:19.902936Z","title":"Few-shot in-context learning for knowledge base question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.902936Z"},"links":{"cited_paper":"/paper/2305.01750","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:9c1291080c8ecea8e24a50301068903022333c367c8b9f93c25aa48277040dda","observation_id":"8dae9957-9eb6-4bc2-9a9e-8f7c14f916a1","resolution":{"observed_at":"2026-08-11T15:40:19.902936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20280","last_updated":"2024-10-26T21:12:32Z","snapshot_observed_at":"2026-08-16T13:05:43.137904Z","submitted_at":"2024-10-26T21:12:32Z","title":"MarDini: Masked Autoregressive Diffusion for Video Generation at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20280","snapshot_observed_at":"2026-08-11T15:40:19.908050Z","title":"Mardini: Masked autoregressive diffusion for video generation at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.908050Z"},"links":{"cited_paper":"/paper/2410.20280","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:8a49dea21df73ccbe5ebcad3c6dfbb9ec2a2c93df8d73c324dcac4983a155558","observation_id":"8613954c-0e30-40fc-ba28-3d48f7efcca2","resolution":{"observed_at":"2026-08-11T15:40:19.908050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12708","last_updated":"2024-04-21T07:17:14Z","snapshot_observed_at":"2026-08-16T15:31:14.769927Z","submitted_at":"2023-05-22T04:37:41Z","title":"ViT-TTS: Visual Text-to-Speech with Scalable Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12708","snapshot_observed_at":"2026-08-11T15:40:19.913235Z","title":"Vit-tts: visual text-to-speech with scalable diffusion transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.913235Z"},"links":{"cited_paper":"/paper/2305.12708","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:1ed147df36279a9635a1b74058841b309cbdd9f0681b0691c19c6915b8162849","observation_id":"27ec997f-2674-4277-b120-5ac0cf44457e","resolution":{"observed_at":"2026-08-11T15:40:19.913235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:19.918443Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.918443Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:b334bc82e95c5654851c20db825cf5c1e024400db39dc996b927558cd049f38c","observation_id":"6e0c2c4f-dc28-4d36-8c38-c357a45b48f6","resolution":{"observed_at":"2026-08-11T15:40:19.918443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:19.923047Z","title":"Video swin transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.923047Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:3fb6d3ea1002b6eaf60a47ec13af98efb9a717507d46f48b8d9917c18b35abbc","observation_id":"e45e4b19-251f-4a57-84fb-06e57d81d9ba","resolution":{"observed_at":"2026-08-11T15:40:19.923047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13311","last_updated":"2023-10-11T06:28:41Z","snapshot_observed_at":"2026-08-16T15:30:58.074613Z","submitted_at":"2023-05-22T17:59:45Z","title":"VDT: General-purpose Video Diffusion Transformers via Mask Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13311","snapshot_observed_at":"2026-08-11T15:40:19.928134Z","title":"Vdt: General-purpose video diffusion transformers via mask modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.928134Z"},"links":{"cited_paper":"/paper/2305.13311","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:68c191b6f026eb38826bf4cc1c44b9c9cb923782a5ca092d31b0bb3e092b7960","observation_id":"dfea9a48-193f-4814-a19e-181fdeb859fc","resolution":{"observed_at":"2026-08-11T15:40:19.928134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-13T10:28:06.516901Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-11T15:40:19.933825Z","title":"Latte: Latent diffusion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.933825Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:5b994644995ab2d9671be3de4a8fdfc4eaf0f6a412752850cbc2da682d4bcdab","observation_id":"eaa28ded-b2b7-4467-8c55-55f5323cde43","resolution":{"observed_at":"2026-08-11T15:40:19.933825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13294","last_updated":"2023-05-09T11:04:43Z","snapshot_observed_at":"2026-08-17T17:45:02.917535Z","submitted_at":"2023-01-30T21:17:15Z","title":"Adaptive Machine Translation with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13294","snapshot_observed_at":"2026-08-11T15:40:19.939173Z","title":"Adaptive machine translation with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.939173Z"},"links":{"cited_paper":"/paper/2301.13294","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:473eab5f7ae45f8b3a71447bb0384a5b49c281638264508979e6b1b01825ba19","observation_id":"b17a4a83-3dd2-426b-ae01-071436f88d75","resolution":{"observed_at":"2026-08-11T15:40:19.939173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:19.944426Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.944426Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:7e7fb16e5a6c32463de17e6615d220ddf36cc18170b5b3b89c90f7661bb996eb","observation_id":"159bcfc3-5ef0-4a03-91fa-56f55ba03fdb","resolution":{"observed_at":"2026-08-11T15:40:19.944426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20222","last_updated":"2024-07-11T16:26:03Z","snapshot_observed_at":"2026-08-16T13:47:40.912032Z","submitted_at":"2024-05-30T16:22:22Z","title":"MOFA-Video: Controllable Image Animation via Generative Motion Field Adaptions in Frozen Image-to-Video Diffusion Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20222","snapshot_observed_at":"2026-08-11T15:40:19.949699Z","title":"Mofa-video: Controllable image animation via generative motion field adaptions in frozen image-to-video diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.949699Z"},"links":{"cited_paper":"/paper/2405.20222","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:9b9d7a1038f0a7a39122a529c50dd36ea2beb710e601911420253e721b6649f6","observation_id":"0ac03540-4608-4609-b467-84498e3e7339","resolution":{"observed_at":"2026-08-11T15:40:19.949699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:19.959829Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.959829Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:2be7c7cf6d4440fed2038a8d3dba14e275d3b29ca3c1f152e0a9122e5a659ddc","observation_id":"fa139526-954e-438c-9817-382508f35773","resolution":{"observed_at":"2026-08-11T15:40:19.959829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06070","last_updated":"2025-03-08T08:43:03Z","snapshot_observed_at":"2026-08-16T13:27:03.453194Z","submitted_at":"2024-08-12T11:41:18Z","title":"ControlNeXt: Powerful and Efficient Control for Image and Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06070","snapshot_observed_at":"2026-08-11T15:40:19.964749Z","title":"Con- trolnext: Powerful and efficient control for image and video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.964749Z"},"links":{"cited_paper":"/paper/2408.06070","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:7dc27db350e53393ae0dba73917168d3a43dc1ca19eb3240b2122189a58116a6","observation_id":"6926e07a-7644-4a5c-a992-4f5415a6b54a","resolution":{"observed_at":"2026-08-11T15:40:19.964749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-17T10:09:03.767186Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-11T15:40:19.970117Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.970117Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:4cc24ae1b20992ce2dc146940b9ef394f1fd533b7f1c3d4479e7a3c868982fd0","observation_id":"26b0b877-64f7-48ac-a3f7-b6561bdac91d","resolution":{"observed_at":"2026-08-11T15:40:19.970117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09881","last_updated":"2024-12-30T04:27:05Z","snapshot_observed_at":"2026-08-16T14:52:00.050104Z","submitted_at":"2023-10-15T16:40:19Z","title":"In-Context Learning with Iterative Demonstration Selection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09881","snapshot_observed_at":"2026-08-11T15:40:19.975980Z","title":"In-context learning with iterative demonstration selection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.975980Z"},"links":{"cited_paper":"/paper/2310.09881","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:51d87adc244014ebe90358dfa689a30fd07853431230f969d6ea86cf2ae262f2","observation_id":"609ca3bd-0352-4dfc-83c0-074e2188de08","resolution":{"observed_at":"2026-08-11T15:40:19.975980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10841","last_updated":"2025-02-15T16:08:40Z","snapshot_observed_at":"2026-08-16T12:58:07.365732Z","submitted_at":"2025-02-15T16:08:40Z","title":"SkyReels-A1: Expressive Portrait Animation in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10841","snapshot_observed_at":"2026-08-11T15:40:19.981858Z","title":"Skyreels-a1: Expressive portrait animation in video diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.981858Z"},"links":{"cited_paper":"/paper/2502.10841","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:9f2888cc6327241b46bf4faefd7f5dc2f3a82592e0a870488b2b317753965fc8","observation_id":"311acede-8374-44c4-842c-75552205808c","resolution":{"observed_at":"2026-08-11T15:40:19.981858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:19.987326Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.987326Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:52599f336e803686dc340772f339ebdfb6a851816263ef28c24baaa742d1bf6e","observation_id":"ca23c518-fe40-46ce-8004-4c58fe96c55f","resolution":{"observed_at":"2026-08-11T15:40:19.987326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:19.992668Z","title":"Improving language understanding with unsupervised learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.992668Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:f539a8e5fecbfb8688a9318323f5b1a5a671836f8305e3960ef4761c48226f39","observation_id":"0944f881-de7b-41b4-a391-310a3d0c5160","resolution":{"observed_at":"2026-08-11T15:40:19.992668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:19.997771Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.997771Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:8ddb15dec4f71ad84111a63c4e1f4a91c1a836c7122ca3707f90cf79cc484edc","observation_id":"741fc7cc-1f1a-45d2-9ebe-0872c0d7eec1","resolution":{"observed_at":"2026-08-11T15:40:19.997771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:20.003196Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.003196Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:4239edbaa4a7e313ec3af60d973ed19234c8ff9952438ad5375b4e8f0bababcb","observation_id":"e36132a8-1dc3-4d37-928f-a2cb3462717a","resolution":{"observed_at":"2026-08-11T15:40:20.003196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:20.008387Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.008387Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:97325ae1693bf9facf5de0ced5413af909e5ef401fba3f481603102a31f4d17c","observation_id":"8032b96b-9897-4ce2-9f76-830bd4689975","resolution":{"observed_at":"2026-08-11T15:40:20.008387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-11T15:40:20.014339Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.014339Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:25d48b8b28779cf6310b824f7a920b4cc39f7970c6073698e11111d8d24c6d82","observation_id":"81feab7c-dc66-408c-8e1a-1492f0dfc7aa","resolution":{"observed_at":"2026-08-11T15:40:20.014339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:20.021755Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.021755Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:abcf8751ff94d322ce9897edd3f86e1d363869010b4471f2da9f6c9959b0a3a3","observation_id":"0133ca99-2169-4821-8c03-5d296e6bb75d","resolution":{"observed_at":"2026-08-11T15:40:20.021755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:20.027407Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.027407Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:72fec27bb0642937a1ba08f362c82cf874f60b84776ee541b646e3bfb7d78cc1","observation_id":"9d5ff2e1-061d-4d92-a5f1-c2f454fe2e1f","resolution":{"observed_at":"2026-08-11T15:40:20.027407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:20.033296Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.033296Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:5f09f093be3b5c2844cd5a20300aa246b7029f5a175f1c1044ada60e1b724a99","observation_id":"74fe4163-53e2-4d1f-b64f-ba1bbb053b20","resolution":{"observed_at":"2026-08-11T15:40:20.033296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:20.038429Z","title":"Palette: Image-to-image diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.038429Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:59bedc06de0946d03bf8d0be299e7b418890c859c32112b1146b1373f27eb809","observation_id":"27e29002-0c80-45e9-a6e0-d793a5f9f26f","resolution":{"observed_at":"2026-08-11T15:40:20.038429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:20.043662Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.043662Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:b5a3644e01f7da1706ac1661e44d6422cf3ecfdb4adb5a0c9c342f7579951fdd","observation_id":"a115041d-4f99-48cb-a834-a4519ba79178","resolution":{"observed_at":"2026-08-11T15:40:20.043662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:20.049433Z","title":"Temporal generative adversarial nets with singular value clipping","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.049433Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:c12d8f0bf3caf9ead4fa97055c1adfa46f38512ea2b4b0be406e5a8b1faa2974","observation_id":"b24974e9-836f-4812-8f36-c9cfbe80b68b","resolution":{"observed_at":"2026-08-11T15:40:20.049433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-11T15:40:20.055466Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.055466Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:48ec8af9c87a1312e493ff6dd78c1b638ef153623cc0f443d3d1f4563a3f0fda","observation_id":"b5a42254-658a-4394-8b08-c02b6e861d05","resolution":{"observed_at":"2026-08-11T15:40:20.055466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:20.061905Z","title":"Segmenter: Transformer for semantic segmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.061905Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:cf48877f28aab8c8bfa95ed7335b2d9c1fb2ee0a29cb701990a33b688d14a0d7","observation_id":"659e2927-d455-4de2-b46f-adff3b125b3f","resolution":{"observed_at":"2026-08-11T15:40:20.061905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16260","last_updated":"2024-06-24T01:56:12Z","snapshot_observed_at":"2026-08-16T13:40:19.376262Z","submitted_at":"2024-06-24T01:56:12Z","title":"Video-Infinity: Distributed Long Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16260","snapshot_observed_at":"2026-08-11T15:40:20.068973Z","title":"Video-infinity: Distributed long video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.068973Z"},"links":{"cited_paper":"/paper/2406.16260","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:92b21fdcfbc9b7e59b0b698732ece32917920d23c18373affa1ff1e91d4bcd57","observation_id":"aad21d50-5ca6-4938-84f5-a634b4f1cfbb","resolution":{"observed_at":"2026-08-11T15:40:20.068973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:20.076395Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.076395Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:725e0f5dea72994594b2e716b9f6557344f003a0e96decd64f989da82ede6727","observation_id":"a9dc9846-6cb8-4d28-8322-5cee112e3008","resolution":{"observed_at":"2026-08-11T15:40:20.076395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:20.083720Z","title":"Mocogan: Decomposing motion and content for video generation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.083720Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:317154dda04ecfaee32048edea362b0cc0c8670b5c3c4d1881fbb0102f826335","observation_id":"36a444ba-594b-44ce-916d-4fd060175df1","resolution":{"observed_at":"2026-08-11T15:40:20.083720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:20.090340Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.090340Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:9255a777dee6cbe6ff898a1a613dd5df960e3b1a169ad3d79be3d135fd1e6e19","observation_id":"6631a51e-40af-4834-8eed-844498cf6879","resolution":{"observed_at":"2026-08-11T15:40:20.090340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:21.859779Z","title":"Phenaki: Variable length video generation from open domain textual descriptions","venue":null,"work_id":"39b66d81-7fc6-43fa-a654-fc683bfad0ae","year":2022},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.095493Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:3616c12c84ca5402e36e0333bb2e8a016544b0b4614b53c23a276d5056072599","observation_id":"410c6557-ead3-477a-9328-285a0b3ccb24","resolution":{"observed_at":"2026-08-11T15:40:21.865559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:20.100726Z","title":"Generating videos with scene dynamics","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.100726Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:f0ead65f4685cd9912b568ae195f7b0d5dd0695bf8f5a99b9a92f876112567ca","observation_id":"5f63bfb7-c163-4629-9e30-2d95271eeb4f","resolution":{"observed_at":"2026-08-11T15:40:20.100726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-11T15:40:20.106573Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.106573Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:0899f99d523fa47c2f425d9d464c67aa206982bad14597b8226f9e3e03f5b5cc","observation_id":"9b01888a-52b5-423c-bad4-5dec7185c72f","resolution":{"observed_at":"2026-08-11T15:40:20.106573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01566","last_updated":"2024-02-02T16:59:48Z","snapshot_observed_at":"2026-08-19T02:09:43.653058Z","submitted_at":"2024-02-02T16:59:48Z","title":"Boximator: Generating Rich and Controllable Motions for Video Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01566","snapshot_observed_at":"2026-08-11T15:40:20.112074Z","title":"Boximator: Generating rich and controllable motions for video synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.112074Z"},"links":{"cited_paper":"/paper/2402.01566","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:396371a57214bd58857ed2e8922b1e8e5a1eb3a151a79990b32c7dd766b4a2ca","observation_id":"362d2a9d-f9e3-40f7-bd9a-d3e631fdc7cd","resolution":{"observed_at":"2026-08-11T15:40:20.112074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14160","last_updated":"2023-12-19T15:13:52Z","snapshot_observed_at":"2026-08-17T13:43:14.591894Z","submitted_at":"2023-05-23T15:26:20Z","title":"Label Words are Anchors: An Information Flow Perspective for Understanding In-Context Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14160","snapshot_observed_at":"2026-08-11T15:40:20.118393Z","title":"Label words are anchors: An information flow perspective for understanding in-context learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.118393Z"},"links":{"cited_paper":"/paper/2305.14160","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:15d04c26f4450802f219d579fa53242150cebc5c240fb5b21814cc12be459d9b","observation_id":"3899b909-679c-4e44-9f48-c4431af1c89f","resolution":{"observed_at":"2026-08-11T15:40:20.118393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:20.123911Z","title":"Pyramid vision transformer: A versatile backbone for dense prediction without convolutions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.123911Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:497869f4d4da550268b1f3acff65323e824b68e31e4fde24db1d5c0a06a47820","observation_id":"22998e89-8373-4d7b-bb70-434c96bfd573","resolution":{"observed_at":"2026-08-11T15:40:20.123911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:20.130021Z","title":"Pvt v2: Improved baselines with pyramid vision transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.130021Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:1399a3b0f535e1f6360ef07f59a8278a92ead59a69fea9c146939248fc00c14a","observation_id":"e2d05f96-8dad-4d96-8b89-c6da3f786633","resolution":{"observed_at":"2026-08-11T15:40:20.130021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03641","last_updated":"2024-07-16T17:27:10Z","snapshot_observed_at":"2026-08-16T14:37:05.498058Z","submitted_at":"2023-12-06T17:49:57Z","title":"MotionCtrl: A Unified and Flexible Motion Controller for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03641","snapshot_observed_at":"2026-08-11T15:40:20.136351Z","title":"Motionctrl: A unified and flexible motion controller for video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.136351Z"},"links":{"cited_paper":"/paper/2312.03641","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:8eda75e437768f96efe34bf7ed2dc4c12752dd5d5353c6a2b76060149ff5522c","observation_id":"1a51d953-4eaf-4ae6-bf10-afade32b0df1","resolution":{"observed_at":"2026-08-11T15:40:20.136351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:21.804879Z","title":"Draganything: Motion control for anything using entity representation","venue":null,"work_id":"852b8964-21b1-4742-9908-d6cc3b9a09fa","year":2025},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.141705Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:c0378b4183f732111293d775c19f4a3e24f275948cdfc2201373d59203f864cf","observation_id":"7c6b44e5-50bd-4f0d-88b3-236d4c09d3d1","resolution":{"observed_at":"2026-08-11T15:40:21.811418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:21.782967Z","title":"Segformer: Simple and efficient design for semantic segmentation with transformers.Advances in Neural Information Processing Systems, 34:12077–12090, 2021","venue":null,"work_id":"331ec62c-1e16-4fbd-b4d5-ddab0fdcc808","year":2021},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.146730Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:e772d172bcdb1906f59dd4a9f430b5e6457a9bab7782ecc34f4826b3dc4725b5","observation_id":"d89c89dd-ea31-43b4-86df-35b5cf8f8bba","resolution":{"observed_at":"2026-08-11T15:40:21.790804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-08-18T17:34:44.890427Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-11T15:40:20.151919Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.151919Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:0740c48936f4b715e5abab3ac569f6e8af2a6ee55f32f63e322ce4ae0d3ee90b","observation_id":"9b24e87c-55a5-47fb-9bd0-412225713398","resolution":{"observed_at":"2026-08-11T15:40:20.151919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02509","last_updated":"2024-06-04T17:27:19Z","snapshot_observed_at":"2026-08-04T13:02:12.217544Z","submitted_at":"2024-06-04T17:27:19Z","title":"CamCo: Camera-Controllable 3D-Consistent Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02509","snapshot_observed_at":"2026-08-11T15:40:20.157664Z","title":"Camco: Camera-controllable 3d-consistent image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.157664Z"},"links":{"cited_paper":"/paper/2406.02509","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:4042299127a3319030e8e6738957720857d844aaa2faae3d7c3cbada329ec053","observation_id":"f3ed8637-5429-4f84-9f6b-0bf4a82bbc12","resolution":{"observed_at":"2026-08-11T15:40:20.157664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-08-17T06:54:13.493934Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-11T15:40:20.163747Z","title":"Videogpt: Video generation using vq-vae and transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.163747Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:d90eb5baf8bb7821195f97712b43e2e72b0f6dddb406176e438f26453adf622f","observation_id":"32337659-badf-4393-a3bc-349918561f04","resolution":{"observed_at":"2026-08-11T15:40:20.163747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03162","last_updated":"2024-05-06T05:37:20Z","snapshot_observed_at":"2026-08-16T14:21:21.917970Z","submitted_at":"2024-02-05T16:30:57Z","title":"Direct-a-Video: Customized Video Generation with User-Directed Camera Movement and Object Motion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03162","snapshot_observed_at":"2026-08-11T15:40:20.169346Z","title":"Direct-a-video: Customized video generation with user-directed camera movement and object motion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.169346Z"},"links":{"cited_paper":"/paper/2402.03162","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:b8655a858d0ed66059fbc0a12da5775432f4aef46a1d1d922510449616fb9cb3","observation_id":"9dd6c1b9-fff3-4f99-a5b6-406c5005b8df","resolution":{"observed_at":"2026-08-11T15:40:20.169346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:20.174556Z","title":"Rerender a video: Zero-shot text-guided video-to-video translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.174556Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:1634dca3b86e73b9ff5d0a3375d4c94d4bbfc5f8ed87950d4cd75c1967d3b9b3","observation_id":"819e559c-5e17-4fce-87d7-bdc50efe1857","resolution":{"observed_at":"2026-08-11T15:40:20.174556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-11T15:40:20.179499Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.179499Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:5ff1b6f4cf1d089b6ec4635f3494edfb71b26fd535491d855d3e271ef9b978d2","observation_id":"e9df9fd9-270a-4cdc-a4c5-d1460d3fcbe5","resolution":{"observed_at":"2026-08-11T15:40:20.179499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:40:20.184805Z","title":"Space-time diffusion features for zero-shot text-driven motion transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.184805Z"},"links":{"citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:67dc4180a5e0668951d91e76d936d38732e17dd322371d2890650f962f79aa00","observation_id":"f151cbcd-bb8c-44b9-925f-dedd05f3d2a7","resolution":{"observed_at":"2026-08-11T15:40:20.184805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T21:56:28.317395Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":97,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":111},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 100 of 111 outbound references and 3 inbound Pith citation observations for arXiv:2412.10783."}