{"as_of":"2026-08-13T11:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:85f4dd5bb2b6d6ffb527b7fe56cc7c09786b15cc0029c41eafc52cd64c280ede","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T18:20:24.588765Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.08393/citation-record","integrity":"/paper/2606.08393/integrity","json":"/paper/2606.08393/citation-record.json","paper":"/paper/2606.08393"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:20:24.588765Z","title":"Diff-Foley: Synchronized video-to-audio synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:e799bb788a73ef35b83cd80a0d0b927cc552e0282551329ca90bc9ffc82112ad","observation_id":"8f266217-a0c5-4a5d-94f7-11b9ca228fac","resolution":{"observed_at":"2026-06-27T18:20:24.588765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:20:24.588765Z","title":"FoleyCrafter: Bring silent videos to life with lifelike and synchronized sounds,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:10ddc42ffb6b51cda673e24fb6e6524716a98486ebadd44c7e028cc15d6ab6a6","observation_id":"ba41b621-6845-44f8-a357-69f53fb8fe9a","resolution":{"observed_at":"2026-06-27T18:20:24.588765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:20:24.588765Z","title":"Tell what you hear from what you see - video to audio generation through text,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:0633ab075427ec930ee963f9e79bc2d062a99966454f88f28b4b4c905760a89c","observation_id":"4316867a-93e6-47cf-a5a5-212acc1d0e0a","resolution":{"observed_at":"2026-06-27T18:20:24.588765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:20:24.588765Z","title":"MMAudio: Taming multimodal joint training for high- quality video-to-audio synthesis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:c3a5fd40839c5f838f6f1a580f0428c5386be47c0cedc313da86155768573c6e","observation_id":"56bdf54d-94cb-49d3-ae2d-c3e708ed681e","resolution":{"observed_at":"2026-06-27T18:20:24.588765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:20:24.588765Z","title":"PrismAudio: Decomposed chain-of-thought and multi- dimensional rewards for video-to-audio generation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:3c4832ffd7c5c3737e9684dc9526bba360c8c02d42fb3ffe8bee1fed52384cdc","observation_id":"4dc22907-9f55-4542-a95b-c71793a589ae","resolution":{"observed_at":"2026-06-27T18:20:24.588765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.20981","last_updated":"2026-04-15T06:35:46Z","snapshot_observed_at":"2026-08-12T20:51:57.046648Z","submitted_at":"2026-02-24T15:01:39Z","title":"Echoes Over Time: Unlocking Length Generalization in Video-to-Audio Generation Models","version":3},"cited_work":{"arxiv_id":"2602.20981","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.20981","snapshot_observed_at":"2026-07-02T23:17:29.635303Z","title":"Echoes Over Time: Unlocking Length Generalization in Video-to-Audio Generation Models","venue":"cs.CV","work_id":"80b5d123-0afa-4c41-bc73-f01319554ec1","year":2026},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"cited_paper":"/paper/2602.20981","citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:40bbc1bf3eca1c3e54cb19abd0a463e521100aa819d0a910373c6e3542c06ebc","observation_id":"67f577bb-e257-447d-a2c9-a1ec3d531ab6","resolution":{"observed_at":"2026-07-02T23:17:29.636908Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:20:24.588765Z","title":"AC- Foley: Reference-audio-guided video-to-audio synthesis with acoustic transfer,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:15090f9f016551b6223b8c4e44cca762adffaaa29d962efa61987effdfc4c1b4","observation_id":"3200a5c9-a463-450c-934c-f40b3c9b0414","resolution":{"observed_at":"2026-06-27T18:20:24.588765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12192","last_updated":"2023-02-23T17:34:53Z","snapshot_observed_at":"2026-07-06T14:55:12.100148Z","submitted_at":"2023-02-23T17:34:53Z","title":"Aligning Text-to-Image Models using Human Feedback","version":1},"cited_work":{"arxiv_id":"2302.12192","doi":"10.48550/arxiv.2302.12192","metadata_source":"pith","pith_arxiv_id":"2302.12192","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Aligning Text-to-Image Models using Human Feedback","venue":"cs.LG","work_id":"39a08cdc-3986-4994-baf0-91e8ddf1b855","year":2023},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"cited_paper":"/paper/2302.12192","citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:2e3508a5d185fb6e32f30d1e43523af7a9c8caf291eb4f078dc50124d6bf4312","observation_id":"2bc0f2e9-60a5-4d7d-babf-52b3b2f3a8c5","resolution":{"observed_at":"2026-07-02T23:17:29.633974Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:20:24.588765Z","title":"Test-time alignment of diffusion mod- els without reward over-optimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:29249f2afcfb58ca162e3474256148a1f69901aec5f873f392c8058dc69f7577","observation_id":"fb771b12-94b5-46ca-b2d4-66dc7e726e22","resolution":{"observed_at":"2026-06-27T18:20:24.588765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:20:24.588765Z","title":"Symbolic music generation with non-differentiable rule guided diffusion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:16f9de8776d69c8e0d72453ae100ba6f8d1c4502f1229c0250162a40ccb01119","observation_id":"42a071a5-0ffc-4efa-b5db-1d26b50709b2","resolution":{"observed_at":"2026-06-27T18:20:24.588765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:20:24.588765Z","title":"Inference-time text- to-video alignment with diffusion latent beam search,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:1bbd1cadf4c0c966ac06e3ca2bd2cfc4fd1b35983adb785d2112118c86283999","observation_id":"beabb127-e16b-43b9-9517-a91b4dc5089e","resolution":{"observed_at":"2026-06-27T18:20:24.588765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.19831","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T23:17:29.638013Z","title":"SCORE: Scaling au- dio generation using standardized composite rewards,","venue":null,"work_id":"5f9fa915-4709-42e6-bf54-4fea0f72c123","year":2025},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:be8b74139fee53d745c197b0f641ebc562cd4e17af8866be3af1aebec2768c21","observation_id":"809d1abe-026f-4810-a99d-d60f97da9c0d","resolution":{"observed_at":"2026-07-02T23:17:29.639630Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:20:24.588765Z","title":"Sequential monte carlo samplers,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:561f74440ea64a65641b8b0b12f56621883eca6c7422c7123252836d61b3c601","observation_id":"1bce797e-4b2b-487a-9461-f33b56f5bc10","resolution":{"observed_at":"2026-06-27T18:20:24.588765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:20:24.588765Z","title":"Synchformer: Efficient synchronization from sparse cues,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:4bac452661d6901c4b2e213f908204883cba9c8aa778744ed87fe9267190e652","observation_id":"23ed9224-ef5b-4807-b16a-54cfbb489cd7","resolution":{"observed_at":"2026-06-27T18:20:24.588765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:20:24.588765Z","title":"Dynamic chunking for end-to- end hierarchical sequence modeling,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:f9796afa2f6bb6a444e8bf395d37fa1e01c68bfb65487c246dbe6dbe1d184acb","observation_id":"0f42320b-bb3f-405b-b9c6-7f95e944b621","resolution":{"observed_at":"2026-06-27T18:20:24.588765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09732","last_updated":"2025-01-16T18:30:37Z","snapshot_observed_at":"2026-07-06T20:22:04.328179Z","submitted_at":"2025-01-16T18:30:37Z","title":"Inference-Time Scaling for Diffusion Models beyond Scaling Denoising Steps","version":1},"cited_work":{"arxiv_id":"2501.09732","doi":"10.48550/arxiv.2501.09732","metadata_source":"pith","pith_arxiv_id":"2501.09732","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Inference-Time Scaling for Diffusion Models beyond Scaling Denoising Steps","venue":"cs.CV","work_id":"e39bf306-0e1f-4ef8-a024-0401d40d08a0","year":2025},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"cited_paper":"/paper/2501.09732","citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:40082570a22f6d0688e480dc3aac191c956dc88298e98d39f2ef06c01616a681","observation_id":"226fdad3-c376-4638-a542-ff5229e94dde","resolution":{"observed_at":"2026-07-02T23:17:29.628265Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:20:24.588765Z","title":"A general framework for inference-time scaling and steering of diffusion models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:0ecc5c64d5c9e4a48af52e090e20d32a6b606bafc31d842eef5698d93e5b06ba","observation_id":"0a84f4e7-67f5-41a2-b210-7d7bef3eba38","resolution":{"observed_at":"2026-06-27T18:20:24.588765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:20:24.588765Z","title":"Diffusion models beat GANs on image synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:643ce5c41af12d03738497657f728ff8950c08065ada43cc13a24b35073770a9","observation_id":"2eb7d162-4dd4-4697-ac0d-2d329f1cf429","resolution":{"observed_at":"2026-06-27T18:20:24.588765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02039","last_updated":"2025-06-02T22:37:06Z","snapshot_observed_at":"2026-08-07T23:06:33.439528Z","submitted_at":"2025-03-03T20:32:05Z","title":"Dynamic Search for Inference-Time Alignment in Diffusion Models","version":2},"cited_work":{"arxiv_id":"2503.02039","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.02039","snapshot_observed_at":"2026-07-03T13:48:21.278885Z","title":"Dynamic search for inference-time alignment in diffusion models","venue":null,"work_id":"07ae55a7-189c-49a1-9e29-0b2edf3224f5","year":2025},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"cited_paper":"/paper/2503.02039","citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:a8804704d9f4d310434e3bb46ae5f2e7ad1f507021218022ab5cc1f24729d940","observation_id":"f3d1149e-21b4-4d86-9cb6-2f45421c339d","resolution":{"observed_at":"2026-07-02T23:17:29.631102Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17618","last_updated":"2025-05-23T08:25:46Z","snapshot_observed_at":"2026-08-09T16:32:39.912773Z","submitted_at":"2025-05-23T08:25:46Z","title":"Scaling Image and Video Generation via Test-Time Evolutionary Search","version":1},"cited_work":{"arxiv_id":"2505.17618","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17618","snapshot_observed_at":"2026-07-04T13:09:50.730002Z","title":"arXiv preprint arXiv:2505.17618 , year =","venue":null,"work_id":"57c6e091-57ae-40da-abcb-41b78bd60702","year":2025},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"cited_paper":"/paper/2505.17618","citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:7d4469f7a0f2ba033b5f88cc1a5e30eefb6c3b8fb03582acaffb1e3281d189fd","observation_id":"5d23bec1-4f79-4fed-bf1e-2ea27c097e34","resolution":{"observed_at":"2026-07-02T23:17:29.625536Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:20:24.588765Z","title":"Flow matching for generative modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:6c39d6985eb5941342a5d72e3178238192a21088b40dbc273631dbebf2fd441a","observation_id":"c0344d0a-46e3-4fd6-a1ed-d3175fdc15f6","resolution":{"observed_at":"2026-06-27T18:20:24.588765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":"2011.13456","doi":"10.1088/1748-9326/aae98d","metadata_source":"pith","pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","venue":"cs.LG","work_id":"d9110e53-a5d4-4794-a4c5-a575e91c31ad","year":2020},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:ba018df7c90f1cb874e2c28f5e72ff2c803eda420366267adc5c97a3f9d7d553","observation_id":"f7a47ae1-002e-4348-940c-3d364e175271","resolution":{"observed_at":"2026-07-02T23:17:29.622788Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:20:24.588765Z","title":"HTS-AT: A hierarchical token-semantic audio transformer for sound classification and detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:7948b246cd3c581cea31811a4983dc17d565448ba1e1448b8c44610d61bb673e","observation_id":"4932171a-6b38-429d-bba3-6be020466039","resolution":{"observed_at":"2026-06-27T18:20:24.588765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:20:24.588765Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:9b44d020d43c034af195df3223918ab7308775b189697fea6eea18fd2908adb1","observation_id":"2203ed8e-e4b3-464d-9347-fcc5c717c751","resolution":{"observed_at":"2026-06-27T18:20:24.588765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:20:24.588765Z","title":"ImageBind: One embedding space to bind them all,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:89cf17c548c95cc45182efd8c809d7eadb1c9a694037a4f24d6111b266661fca","observation_id":"a6b129f5-c755-4ca6-8fb6-e0f418bf6369","resolution":{"observed_at":"2026-06-27T18:20:24.588765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-07-06T20:33:01.960703Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"cited_work":{"arxiv_id":"2502.05139","doi":"10.48550/arxiv.2502.05139","metadata_source":"pith","pith_arxiv_id":"2502.05139","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","venue":"cs.SD","work_id":"7cba92d8-f51e-4a64-8d1d-6d4cf1f56377","year":2025},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"cited_paper":"/paper/2502.05139","citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:3f6f159c271e00b41a8eebc33b229f4fee01db7403a37987b943fd4b33ccfa25","observation_id":"c9edc96f-9bc9-4667-b44c-c34bf8ffd557","resolution":{"observed_at":"2026-07-02T23:17:29.620375Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:20:24.588765Z","title":"Improved particle filter for nonlinear problems,","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:dee6246ae6670ed79ea8ec59a8e2543e5590ddb0ee2cc0fd467f2d21ff525d33","observation_id":"f5cbcf12-c892-48a7-8048-019c15de33a8","resolution":{"observed_at":"2026-06-27T18:20:24.588765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:20:24.588765Z","title":"Negative association, ordering and convergence of resampling methods,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:c6ce9b3855ab5d76a8c5e015cb4f1ba04e613627ad2fe8f7becd705b55eabcc5","observation_id":"a0b15939-bf1a-42d6-82df-cbd363e79325","resolution":{"observed_at":"2026-06-27T18:20:24.588765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:20:24.588765Z","title":"VGGSound: A large-scale audio-visual dataset,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:a7a01023be256ede1c8ba77096792ff6c3a38631df97270e2cc0ae1b741c1f32","observation_id":"64fed236-bce3-4def-8f20-0040893abc33","resolution":{"observed_at":"2026-06-27T18:20:24.588765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:20:24.588765Z","title":"AGA V-Rater: Adapting large multimodal model for AI-generated audio-visual quality assess- ment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T18:20:24.588765Z"},"links":{"citing_paper":"/paper/2606.08393"},"observation_digest":"sha256:053d7b0672d26e88eb676b87e7aa07569231e39a33d3fd7606c9837013c0d1e6","observation_id":"60f57178-b473-4595-952c-74d889ee6dae","resolution":{"observed_at":"2026-06-27T18:20:24.588765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.08393","last_updated":"2026-06-07T01:10:11Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-09T16:30:39.381773Z","submitted_at":"2026-06-07T01:10:11Z","title":"SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":22,"verified_exact":7,"verified_fuzzy":0},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2606.08393."}