Pith. sign in

Paper Citation Record · LEDGER

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation

As of 23 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 6 inbound Pith citation observations for arXiv:2412.01429.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.01429 v1

Coverage vector

measured 44 of 44 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-12T04:27:23.961584Z

measured 50 of 50 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-23T06:30:58.430688+00:00

measured 6 of 6 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-16T11:31:56.557164Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-08T13:14:53.230368Z

Reference resolution

44 of 44 outbound references displayed

  • verified exact1
  • verified fuzzy4
  • unresolved39
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation de75c182-9d32-4a78-a6cd-fef5bf8a4241 · outbound

This paper cites VD3D: Taming Large Video Diffusion Transformers for 3D Camera Control.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation VD3D: Taming Large Video Diffusion Transformers for 3D Camera Control

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.813459Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.813459Z digest=sha256:b32bfdafaae2b91082645faeb92e6d190238b0d2dd55cb543830b7d538c55ba8

Observation 18176a46-c1fd-4228-b5f5-1d1e321a218a · outbound

This paper cites Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.817811Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.817811Z digest=sha256:2a00ea2cfc8f7a7fc5d3f46e8f45817c41378ea5311dc951c11cc6fa720fd045

Observation 1058d776-3378-4430-885a-d9398bac372a · outbound

This paper cites Lumiere: A Space-Time Diffusion Model for Video Generation.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Lumiere: A Space-Time Diffusion Model for Video Generation

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.821334Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.821334Z digest=sha256:3252b184dca4e7c315324a2e0692966543bd96af23d018f39f0f4945fa2b28f0

Observation 3db66a20-5065-4c40-85ea-92dddfad7f83 · outbound

This paper cites Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.825112Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.825112Z digest=sha256:ebd7c01f183982b168c8b9cf29bafe051afa62cfd4b899dbde8b8237c46e7245

Observation c6b43b03-83d9-4767-a7dd-d6ca085a50ac · outbound

This paper cites Align your latents: High-resolution video synthesis with la- tent diffusion models.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Align your latents: High-resolution video synthesis with la- tent diffusion models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.828439Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.828439Z digest=sha256:4ba800aaa23dccab17edb5a9f195f6c44816bc43c462f6c3e2e55b9b49643d7c

Observation 2d6d0dcd-983a-4e27-a9a5-dae767b9c692 · outbound

This paper cites Video generation models as world simulators.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Video generation models as world simulators

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.832123Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.832123Z digest=sha256:7b247ceb90db04531bab20b371fcb93021c9043f73d8a6dd5f96ae4eef5b1713

Observation d853d41b-fdbc-4258-b218-d3fa3b74666f · outbound

This paper cites AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.835282Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.835282Z digest=sha256:21707987543c0cb789fb01eb93ef8611f642cc052acffc2cbf866a4df69349ff

Observation 09391abc-29df-48d1-83df-4e149c19c5ad · outbound

This paper cites CameraCtrl: Enabling Camera Control for Text-to-Video Generation.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation CameraCtrl: Enabling Camera Control for Text-to-Video Generation

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.838425Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.838425Z digest=sha256:dc2eace706141d836afa997d9e007a39a2b946f189629dd7c77937871f680b17

Observation a6759fc9-7867-413c-a7b4-8b8dc93e79d5 · outbound

This paper cites Latent Video Diffusion Models for High-Fidelity Long Video Generation.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Latent Video Diffusion Models for High-Fidelity Long Video Generation

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.842331Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.842331Z digest=sha256:ecc11d6a32b8354541ced07d9e928d507eca9dada6874333a0c095404ca87c91

Observation 5e3ed682-983e-4bf7-9491-c51188e56750 · outbound

This paper cites Gans trained by a two time-scale update rule converge to a local nash equilib- rium.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Gans trained by a two time-scale update rule converge to a local nash equilib- rium

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.845731Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.845731Z digest=sha256:c26781caec2ddd7b50cac7bed61d6217cf3ca60324b94cddcd7e9efb4407c645

Observation d75bf06a-b55f-4b26-97b2-aaacf96983f9 · outbound

This paper cites Viewdiff: 3d-consistent image generation with text-to-image models.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Viewdiff: 3d-consistent image generation with text-to-image models

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T04:27:24.461948Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-12T04:27:23.849268Z digest=sha256:8d8c0e250d3ced4c1f4c120e202a966a813a4560c1428ea18b11a378b7f0c9ba

Observation 12bdc955-d345-4aeb-bdee-b920976583fe · outbound

This paper cites Auto-Encoding Variational Bayes.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Auto-Encoding Variational Bayes

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.852289Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.852289Z digest=sha256:5259d5c4afe2756d4a93adcee85bd31c9c2985d0b0602976aea2b375186b81b6

Observation 633b8694-2359-43fc-8f3e-c7c130a25c47 · outbound

This paper cites Open-sora-plan, Apr.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Open-sora-plan, Apr

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T04:27:24.453452Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-12T04:27:23.855209Z digest=sha256:6d15870a9b805ba0c28eb32632b3c935b0bd956e80357a43e1bef6859df092f7

Observation 342b0032-d57f-428d-9985-152c735dbf38 · outbound

This paper cites Image Conductor: Precision Control for Interactive Video Synthesis.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Image Conductor: Precision Control for Interactive Video Synthesis

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.859075Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.859075Z digest=sha256:088c8ea5bd110a7314d267cfac417b94eab78507e759dfdd1d7c1c1a4ba7e328

Observation b461ecc0-8f53-41a4-b196-5e13dd923144 · outbound

This paper cites MotionClone: Training-Free Motion Cloning for Controllable Video Generation.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation MotionClone: Training-Free Motion Cloning for Controllable Video Generation

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.863343Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.863343Z digest=sha256:4d938ccb11164c510cec97b5d10fe1b7e9e119400e6808399fb294e06f0f2d03

Observation ead47118-fd64-4ded-8a03-3cfa1d48b252 · outbound

This paper cites Latte: Latent Diffusion Transformer for Video Generation.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Latte: Latent Diffusion Transformer for Video Generation

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.867452Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.867452Z digest=sha256:750213b330c8b2cd0e78d4db78cb2d1d5b4121de84cf5138f916784ffa657c20

Observation e56085ee-bc6e-46cf-a9b0-5689b14173c0 · outbound

This paper cites Snap video: Scaled spatiotemporal transformers for text-to-video synthesis.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Snap video: Scaled spatiotemporal transformers for text-to-video synthesis

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.870370Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.870370Z digest=sha256:f65b64b118bdc18c86e9251fd8d8138db07aa108c4509206dc31e6b59e0742cd

Observation 2909fe51-d675-4c41-8c41-972f7ce4918d · outbound

This paper cites Scalable diffusion models with transformers.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Scalable diffusion models with transformers

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.873306Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.873306Z digest=sha256:6dc3f2181f2a6a12e678ace4b8e9317880ab70c7addc90bec1565f5494e2e0f8

Observation 0622a274-3378-49f2-9c12-211c7758b617 · outbound

This paper cites ControlNeXt: Powerful and Efficient Control for Image and Video Generation.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation ControlNeXt: Powerful and Efficient Control for Image and Video Generation

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.876586Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.876586Z digest=sha256:504998b4d93309d5dc1be727882e8eaeaeb5ff410a3d94e6ec68a6d961ab1079

Observation 18261bcb-84ef-47c4-ae04-b1c5d16b9bda · outbound

This paper cites Camera Pose Estimation from Lines using Pl\"ucker Coordinates.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Camera Pose Estimation from Lines using Pl\"ucker Coordinates

Reference 20

Resolution
verified exact
local_arxiv, observed 2026-08-12T04:27:24.152443Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-12T04:27:23.879278Z digest=sha256:5e7b45a5ec8de9c4096dc7274553d9c757103b7fe15cce7ae7cff64db14116b3

Observation ef2147e6-f2b9-4beb-852c-3d1d69668411 · outbound

This paper cites FreeTraj: Tuning-Free Trajectory Control in Video Diffusion Models.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation FreeTraj: Tuning-Free Trajectory Control in Video Diffusion Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.882904Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.882904Z digest=sha256:2331e16d281ae1030b7afcb02d95e580240f3cbb5bd0b0432ce288ca600ed5af

Observation a2379fd0-42aa-4d16-ac4b-bc40dd9d1980 · outbound

This paper cites Learning transferable visual models from natural language supervi- sion.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Learning transferable visual models from natural language supervi- sion

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.886496Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.886496Z digest=sha256:2c9db8873fe08e1b1629d63a4511e6d80a27703f3116a325ca7021a4afc3ae25

Observation 8a359540-bf12-4bcb-b7d8-9f162e88ed74 · outbound

This paper cites ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.889110Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.889110Z digest=sha256:fbcf1d9cc56331266d8647e7cdae7643e7bc3b97f4f9b066259d0f120ca7feb1

Observation dd3f14b3-8661-41d9-8570-84e4c0f80ec1 · outbound

This paper cites High-resolution image synthesis with latent diffusion models.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation High-resolution image synthesis with latent diffusion models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.892038Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.892038Z digest=sha256:2d12ee78c551dd459e5dae3f0d8a3e1778efed3e210002441667e1e23988cf35

Observation 7d9df514-f670-410a-9fef-6fae39696b53 · outbound

This paper cites U- net: Convolutional networks for biomedical image segmen- tation.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation U- net: Convolutional networks for biomedical image segmen- tation

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.894517Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.894517Z digest=sha256:3082e723e7e3e82056e71e94a05331f3da5660d8dd15ddcc93d30e292918b806

Observation 39e54735-5c10-4d5b-b358-85b51747d9f8 · outbound

This paper cites Motion-i2v: Consistent and controllable image-to-video generation with explicit motion modeling.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Motion-i2v: Consistent and controllable image-to-video generation with explicit motion modeling

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.897017Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.897017Z digest=sha256:a61d43ba28b4ee74947419bffebbc4b7306d4503b4b7ab78376665dc9f8f3442

Observation ed3a6280-6720-48c5-b50c-7bca7afe689d · outbound

This paper cites Make-A-Video: Text-to-Video Generation without Text-Video Data.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Make-A-Video: Text-to-Video Generation without Text-Video Data

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.899812Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.899812Z digest=sha256:74dc8c4f6bb98fc07c523824a22e234a364648834cc96f5eb8f42710d45bf644

Observation 2045f34c-e907-4bdf-98df-9658e7c82496 · outbound

This paper cites Towards Accurate Generative Models of Video: A New Metric & Challenges.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Towards Accurate Generative Models of Video: A New Metric & Challenges

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.903469Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.903469Z digest=sha256:b859d744585d46d3f1a84ded6e96c43737ce4741b138cf827410a8342fa665dd

Observation 9e1ec310-70cf-4855-a737-cefe9928480a · outbound

This paper cites Attention is all you need.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Attention is all you need

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.907673Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.907673Z digest=sha256:d4b2a9245392acdbad0d8bc32a88f01cf355390333fc7fa95eaf544c272f66d2

Observation 542cb353-e57b-4d77-9c40-a167f9a9d253 · outbound

This paper cites Videocomposer: Compositional video synthesis with motion controllability.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Videocomposer: Compositional video synthesis with motion controllability

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.911493Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.911493Z digest=sha256:a3c0ec447bc0728169132eb93fba323f4ddfbb6d05ab849ca224e82c6d266df3

Observation 268d6f7b-6da7-4212-85b0-44648f96910e · outbound

This paper cites Motionctrl: A unified and flexible motion controller for video generation.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Motionctrl: A unified and flexible motion controller for video generation

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T04:27:24.366431Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-12T04:27:23.916176Z digest=sha256:f793fef819331471154b3161c559a3c17cfb96ee20d12fec8f7ae309ce01b16a

Observation 485b7f1f-f814-44c3-bc9f-cef3e34f6295 · outbound

This paper cites Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.919342Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.919342Z digest=sha256:c85deeff693b32f16f252bb064aa23f12db8c90ea9f27433144008de0a02c96d

Observation 5c7da6a6-ae24-4bd9-9f90-00a6861d5442 · outbound

This paper cites Easyanimate: A high-performance long video generation method based on transformer architecture.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Easyanimate: A high-performance long video generation method based on transformer architecture

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.922762Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.922762Z digest=sha256:239a7d34c2ccbfeb486df8cf0567f19bf4f1b06b6363698ca4c022b6da7d178b

Observation 4462fe77-b3e4-4f70-8ad0-a2283f2bcd97 · outbound

This paper cites Direct-a-video: Customized video generation with user- directed camera movement and object motion.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Direct-a-video: Customized video generation with user- directed camera movement and object motion

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.926327Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.926327Z digest=sha256:14f534d1d3c7a4236f2cd0f5907b67b42de53186758046215553b1918eb8ca4e

Observation 48c9408e-24c8-4bd8-aa4e-b83341901cb6 · outbound

This paper cites CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.929975Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.929975Z digest=sha256:c3d53aa800a272deea2b534e0a070ea45adc0e010fca0e5d0587baed4f214f17

Observation a5fde941-6529-4b24-80b1-079fa01858f6 · outbound

This paper cites Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.934295Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.934295Z digest=sha256:be3788eedeba7c8307706a3ea61dc0bbab2f39f850b128e20a13876655b3742d

Observation c5313ece-20d0-4c53-904b-9bf7b5cebe05 · outbound

This paper cites Make pixels dance: High- dynamic video generation.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Make pixels dance: High- dynamic video generation

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.938432Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.938432Z digest=sha256:22fb4abc840dbc4d138cc8d7caea9aaa736cdd7e3610f69ca09544d947994d5a

Observation c144e0e4-0e9a-49a4-bfa5-95e0fd6449d6 · outbound

This paper cites Adding conditional control to text-to-image diffusion models.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Adding conditional control to text-to-image diffusion models

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.941286Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.941286Z digest=sha256:a2d761194e78cda1bafca87d00d1a5ceb278b330d2a9d161eee47f6f5dde24c1

Observation 73ce45e6-ee7e-45a6-95a2-88f5432abf8c · outbound

This paper cites VideoElevator: Elevating Video Generation Quality with Versatile Text-to-Image Diffusion Models.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation VideoElevator: Elevating Video Generation Quality with Versatile Text-to-Image Diffusion Models

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.944272Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.944272Z digest=sha256:4836a4cbcfe57cea3d9407641843531206ba700b0b43c751965ed9e1f255cb9b

Observation 97349bd6-341d-421f-b316-ff32542943e7 · outbound

This paper cites Tora: Trajectory-oriented Diffusion Transformer for Video Generation.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Tora: Trajectory-oriented Diffusion Transformer for Video Generation

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.948134Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.948134Z digest=sha256:466d0f01481b7d1080c2b494ef3af323f6980d9b5450845a077eaadda2397c85

Observation 4f38f51a-2601-4a39-8941-fead5881bb81 · outbound

This paper cites Open-sora: Democratizing efficient video production for all, March 2024.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Open-sora: Democratizing efficient video production for all, March 2024

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T04:27:24.263078Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-12T04:27:23.951170Z digest=sha256:bea7c29c8643bcd3010d851eb54a07301e50b1ddbcdfa8ed768ccc94b027146c

Observation 9b21d600-fc14-4b0f-bfdf-6703420d0de2 · outbound

This paper cites MagicVideo: Efficient Video Generation With Latent Diffusion Models.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation MagicVideo: Efficient Video Generation With Latent Diffusion Models

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.954581Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.954581Z digest=sha256:9ff410d66c353488b0742d5d83e98c63bbc72c973d380d0060e2578782c82684

Observation 2e4d3c42-fe87-4756-8310-4a2d59f7f9ba · outbound

This paper cites TrackGo: A Flexible and Efficient Method for Controllable Video Generation.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation TrackGo: A Flexible and Efficient Method for Controllable Video Generation

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.958007Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.958007Z digest=sha256:b71a35a679a5368236773c76929f8fa81cfa5701350b9b55312ced4c041bcd42

Observation bf3cd07e-ead4-4dcb-ac5e-72790b8033b2 · outbound

This paper cites Stereo Magnification: Learning View Synthesis using Multiplane Images.

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation Stereo Magnification: Learning View Synthesis using Multiplane Images

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-12T04:27:23.961584Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:27:23.961584Z digest=sha256:0bc0cb055a738651c3554e8f1a9d5c014d18a092be004a1918e2b6c2f975f34d

Pith citing papers

Observation 906bfd6f-8013-4310-94ac-5ccfc9222fd2 · inbound

Wonderland: Navigating 3D Scenes from a Single Image cites this paper.

Wonderland: Navigating 3D Scenes from a Single Image CPA: Camera-pose-awareness Diffusion Transformer for Video Generation

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-11T14:21:06.438179Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:21:06.438179Z digest=sha256:9825f1faadd35764c43874a702be333a1a119e2605940dd0160950d313e3c49c

Observation c13e7384-7680-4cde-bc54-3664d9db2ddb · inbound

Towards Understanding Camera Motions in Any Video cites this paper.

Towards Understanding Camera Motions in Any Video CPA: Camera-pose-awareness Diffusion Transformer for Video Generation

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-16T11:31:56.557164Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:31:56.557164Z digest=sha256:da2dcbc6d13b2d5a04ec593638a6f61dada33f60be22ea71ed133db13d4dec3d

Observation 2da49068-e7c5-4b66-9210-16ef64f8daaa · inbound

PostCam: Camera-Controllable Novel-View Video Generation with Query-Shared Cross-Attention cites this paper.

PostCam: Camera-Controllable Novel-View Video Generation with Query-Shared Cross-Attention CPA: Camera-pose-awareness Diffusion Transformer for Video Generation

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-03T21:01:09.717580Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:01:09.717580Z digest=sha256:72450c552be333ba7d5218281d04b55e0d989dcf79c9a556282069d5d3d8e50b

Observation 10f5b3dd-d34b-4498-bfe9-796c3f84fddd · inbound

INSPATIO-WORLD: A Real-Time 4D World Simulator via Spatiotemporal Autoregressive Modeling cites this paper.

INSPATIO-WORLD: A Real-Time 4D World Simulator via Spatiotemporal Autoregressive Modeling CPA: Camera-pose-awareness Diffusion Transformer for Video Generation

Reference 82

Resolution
verified exact
arxiv_id, observed 2026-05-10T23:25:53.620621Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-10T19:08:56.588282Z digest=sha256:3ca635cd59039fc7f3980a3f0565dcd88b0adf378e28fd70b79766aa477cffc5

Observation 946cfa7e-1fd1-4d7d-bc57-a8c3b469e6c7 · inbound

MoWorld: A Flash World Model cites this paper.

MoWorld: A Flash World Model CPA: Camera-pose-awareness Diffusion Transformer for Video Generation

Reference 53

Resolution
verified exact
local_arxiv, observed 2026-07-08T13:14:53.231664Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-07-08T13:10:31.940263Z digest=sha256:37ae5a6f95cc610e6a2f62daa8ea6f9ca8a0644eaace2c162e19155f8874b40a

Observation 31736638-c83b-4486-b12b-f485078ba375 · inbound

MoWorld: A Flash World Model cites this paper.

MoWorld: A Flash World Model CPA: Camera-pose-awareness Diffusion Transformer for Video Generation

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-04T04:32:04.143490Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T04:32:04.143490Z digest=sha256:667900f0dbd7ac1cf5f8baa7e18bb74589a0fd4c58d3c7dcf2f8aca7dd77f446