Pith. sign in

Paper Citation Record · LEDGER

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation

As of 7 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 1 inbound Pith citation observation for arXiv:2605.12480.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2605.12480 v1

Coverage vector

measured 23 of 23 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-13T06:16:20.612291Z

measured 24 of 24 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-06T06:34:29.942622+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-27T17:07:57.743780Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-03T00:37:29.795659Z

Reference resolution

23 of 23 outbound references displayed

  • verified exact19
  • verified fuzzy2
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch2

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 4dc386b4-a694-4d6b-996e-b3d8b06be350 · outbound

This paper cites Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets.

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets

Reference 1

Resolution
verified exact
local_arxiv, observed 2026-05-13T06:17:22.926828Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T06:16:20.612291Z digest=sha256:3aa676d7ee0879b86a61a8772790866e66c09f7a3d0a7d54a21686b6a05319ec

Observation 12dd018e-0aad-4d75-9e9d-1619b69a25eb · outbound

This paper cites ACE-Step: A Step Towards Music Generation Foundation Model.

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation ACE-Step: A Step Towards Music Generation Foundation Model

Reference 2

Resolution
metadata mismatch
arxiv_id, observed 2026-05-13T06:17:22.920096Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T06:16:20.612291Z digest=sha256:2537e67c2deec574495e4f81400e35fc67844796ff3784046b2951384ada7d6e

Observation be662eb6-447e-499c-a9b2-589de9280ed5 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 3

Resolution
metadata mismatch
local_arxiv, observed 2026-05-13T06:17:22.923347Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T06:16:20.612291Z digest=sha256:7d7dd995cbbf6e7cb479cf779b6502bb312c9114ba4bb2642d4546d51c483770

Observation a7a83924-9ad0-4f94-8c00-4aa561b22fb7 · outbound

This paper cites AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning.

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-05-13T06:17:22.873410Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T06:16:20.612291Z digest=sha256:1e7b5e2dbe06f1367fafff4fa2e74dab36ad426d0f4cb764e6588d2476b7fdb8

Observation 27021791-c230-4d85-ae73-158f8b233622 · outbound

This paper cites LTX-Video: Realtime Video Latent Diffusion.

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation LTX-Video: Realtime Video Latent Diffusion

Reference 5

Resolution
verified exact
local_arxiv, observed 2026-05-13T06:17:22.908305Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T06:16:20.612291Z digest=sha256:74127ceff13c603965a5d5e7a1ff0351dbeae488f243269ce1db794823d8aed2

Observation 7b945336-8d84-4657-9638-6040fbf8ce0f · outbound

This paper cites LTX-2: Efficient Joint Audio-Visual Foundation Model.

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation LTX-2: Efficient Joint Audio-Visual Foundation Model

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-05-13T06:17:22.861138Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T06:16:20.612291Z digest=sha256:02fc0a2bf896f3296aa29e27c97f5e7c0dc0e93b1fcf326e5fe2b8e97ded5813

Observation 2ad5d61b-2ff8-426f-8e9e-e7c7c9ff3f53 · outbound

This paper cites TempFlow-GRPO: When Timing Matters for GRPO in Flow Models.

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation TempFlow-GRPO: When Timing Matters for GRPO in Flow Models

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-05-21T21:52:31.656662Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T06:16:20.612291Z digest=sha256:ac1029415ad3def84c4750f06f8732a5f8826f60c54c0a85171cc548e492b77b

Observation 300f3a7f-94d1-49d4-ad7f-82225ffa8813 · outbound

This paper cites CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers.

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-05-13T06:17:22.898454Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T06:16:20.612291Z digest=sha256:b9f2b834a77c0de87f2f9cf55adf340c0eb438f4ed3df2d1b40ae2889e317c6d

Observation 1884f812-b595-46c1-9eab-013cb80bb174 · outbound

This paper cites Synchformer: Efficient synchro- nization from sparse cues.

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation Synchformer: Efficient synchro- nization from sparse cues

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-05-13T06:17:23.633805Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T06:16:20.612291Z digest=sha256:a9fab793657c6c83e04477be42969dc1fc37807bf5cf17f6a0333005552770fe

Observation e6700c57-373d-48c6-b095-86a15dd7376c · outbound

This paper cites T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT.

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-05-13T06:17:22.912538Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T06:16:20.612291Z digest=sha256:7e760326dc8d9fff62ee7c3044f746c3f3f6a8ae3af3548a5d3ec40037df3407

Observation 392f24aa-cd26-4874-897c-73e018810d60 · outbound

This paper cites HunyuanVideo: A Systematic Framework For Large Video Generative Models.

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation HunyuanVideo: A Systematic Framework For Large Video Generative Models

Reference 11

Resolution
verified exact
local_arxiv, observed 2026-05-13T06:17:22.857473Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T06:16:20.612291Z digest=sha256:68838e43c894eb7e7ec203535939d711800b4ba3b29242844604f9582aeb2f76

Observation 855ab3cb-01ab-4590-87a2-c7f8f7a414ae · outbound

This paper cites MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE.

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-05-13T13:27:50.191417Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T06:16:20.612291Z digest=sha256:ac4e1e85a3ae8a15beea7fdcfcc1078a23860ae1c03149491d3da2afdd6fffe4

Observation 205309c3-2cda-43b4-a340-73bd1dac37b3 · outbound

This paper cites Flow Matching for Generative Modeling.

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation Flow Matching for Generative Modeling

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-05-13T06:17:22.916304Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T06:16:20.612291Z digest=sha256:735e68bb5f2af6ecd3138a9d7ec4c692275c0978fc8056c4065c8badd7d4df69

Observation b028b4da-2fc5-43f6-b702-f5cda34d6c80 · outbound

This paper cites Flow-GRPO: Training Flow Matching Models via Online RL.

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation Flow-GRPO: Training Flow Matching Models via Online RL

Reference 14

Resolution
verified exact
local_arxiv, observed 2026-05-13T06:17:22.895840Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T06:16:20.612291Z digest=sha256:efd808210bc06cc0cb19292aaf73a3831e42ab906d9a56a9da45a102f6825712

Observation a91f9575-685c-4a1b-b450-6a4a6d1c9049 · outbound

This paper cites Reinforcement learning meets masked generative models: Mask- grpo for text-to-image generation.arXiv preprint arXiv:2510.13418.

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation Reinforcement learning meets masked generative models: Mask- grpo for text-to-image generation.arXiv preprint arXiv:2510.13418

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-05-13T06:17:22.902118Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T06:16:20.612291Z digest=sha256:2aeccff7c99d64b048b7dc95ebfc7e6650dc6291623f57359f21b00211c2feb7

Observation 1ebd594e-cd1e-4c7a-bae8-2a85e5baa869 · outbound

This paper cites Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model.

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-05-16T01:35:37.953991Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T06:16:20.612291Z digest=sha256:596b62534c7aee3cb36b092c1bfab17cbac4feb41781280149f870a9040b6aec

Observation d3267305-6caa-4017-b1eb-e5fb8da8e1b4 · outbound

This paper cites Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound.

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound

Reference 17

Resolution
verified exact
arxiv_id, observed 2026-05-17T00:30:51.554172Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T06:16:20.612291Z digest=sha256:f2137010f0abd43a84ef01d3427de2f7acddf91c41b2c0c21c72cbbce80e9a1f

Observation e95811c5-261b-4ff0-af4a-3416c73dda06 · outbound

This paper cites Wan: Open and Advanced Large-Scale Video Generative Models.

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation Wan: Open and Advanced Large-Scale Video Generative Models

Reference 18

Resolution
verified exact
local_arxiv, observed 2026-05-13T06:17:22.888200Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T06:16:20.612291Z digest=sha256:f52c750dabb9211c6669ec8f24822c11e18b2fd269ab03be4f156f1df75ec12e

Observation 40909ab5-c1bb-48c9-b9c9-873d1f379e59 · outbound

This paper cites UniVerse-1: Unified Audio-Video Generation via Stitching of Experts.

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation UniVerse-1: Unified Audio-Video Generation via Stitching of Experts

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-05-13T06:17:22.892743Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T06:16:20.612291Z digest=sha256:0885e2c144fe18768f5d6caed0d5edb78d71aabb2fdbaa22801f78807d2b83a3

Observation 9750d8c9-1f13-41be-a117-f4abb0adb09c · outbound

This paper cites Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation.

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-05-13T06:17:23.631649Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T06:16:20.612291Z digest=sha256:0ab174faf94296b53b4e3ba1e0e2c4d037787f99ff791ad2ec256df43329eb6d

Observation 5ab3ade3-262f-4b3b-87f8-8d4cb74e0407 · outbound

This paper cites DanceGRPO: Unleashing GRPO on Visual Generation.

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation DanceGRPO: Unleashing GRPO on Visual Generation

Reference 21

Resolution
verified exact
local_arxiv, observed 2026-05-13T06:17:22.863951Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T06:16:20.612291Z digest=sha256:dc3fd2a0acfa1e5dfe238c104c64bb445cc0ec078d5af537e2b7684e666ee0a9

Observation ccc090f9-7b05-45ce-bb1d-82e5bbde78d5 · outbound

This paper cites Maskfocus: Focusing policy optimization on critical steps for masked image generation.

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation Maskfocus: Focusing policy optimization on critical steps for masked image generation

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-05-13T06:17:22.905797Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T06:16:20.612291Z digest=sha256:0b3efd7451f978876f4a38a934d7d00edce2f186fd05bc712d0861e4dd3ec723

Observation d092edc2-7126-4bbd-8918-0df2b68d53bd · outbound

This paper cites DiffusionNFT: Online Diffusion Reinforcement with Forward Process.

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation DiffusionNFT: Online Diffusion Reinforcement with Forward Process

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-13T16:54:31.055857Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T06:16:20.612291Z digest=sha256:7facfc40ba3198c61e300508317c2a380b203b0d7c34d80089926f28c98dc2b0

Pith citing papers

Observation a73a3a1f-3c7c-4d68-b8c0-cdc50d5cde2b · inbound

Ultra Flash: Scaling Real-Time Streaming Video Generation to High Resolutions cites this paper.

Ultra Flash: Scaling Real-Time Streaming Video Generation to High Resolutions OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation

Reference 3

Resolution
metadata mismatch
local_arxiv, observed 2026-07-03T00:37:29.797241Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-06-27T17:07:57.743780Z digest=sha256:1814c83a9445c6ccef53c4a17df737df8a17270b8c12ad6d5f29641cef300086