{"as_of":"2026-08-05T07:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:47eed6ce8e7df631e4eccbc353da5370758265b5ac76d649034965ddfc39aac8","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T13:10:29.213917Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.01703/citation-record","integrity":"/paper/2606.01703/integrity","json":"/paper/2606.01703/citation-record.json","paper":"/paper/2606.01703"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":"2301.11325","doi":"10.48550/arxiv.2301.11325","metadata_source":"pith","pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MusicLM: Generating Music From Text","venue":"cs.SD","work_id":"15e6566e-1c36-468f-966e-823248cbf87f","year":2023},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:b058c0757f2439627f1e254b5708950a56deba30073539f79f00ee259952a7a9","observation_id":"f61a8482-72d6-4445-a7ad-f9aa7142aef3","resolution":{"observed_at":"2026-07-02T00:56:24.676205Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09214","last_updated":"2024-09-19T07:14:20Z","snapshot_observed_at":"2026-07-06T19:15:17.200627Z","submitted_at":"2024-09-13T22:06:18Z","title":"Seed-Music: A Unified Framework for High Quality and Controlled Music Generation","version":3},"cited_work":{"arxiv_id":"2409.09214","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.09214","snapshot_observed_at":"2026-07-02T04:46:38.046767Z","title":"Seed-music: A unified frame- work for high quality and controlled music generation","venue":null,"work_id":"60137b87-df1b-495a-9d13-c083563014d2","year":2024},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"cited_paper":"/paper/2409.09214","citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:16518c8e3ae43b3a013c7eb0c677ba1c8528bde63578170e8091c4cbf1b5d730","observation_id":"ddceba15-82dc-4022-9073-154217ac5ad3","resolution":{"observed_at":"2026-07-02T00:56:24.636627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:10:29.213917Z","title":"Ke Chen, Yusong Wu, Haohe Liu, Marianna Nezhurina, Taylor Berg-Kirkpatrick, and Shlomo Dub- nov","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:c6e8fbb3bd362eaca4bf77a4ab0bcb0de42cf341333aa296bf1bc84524eabdcf","observation_id":"cb41cb2c-d56d-442a-8bb9-eca7e396b313","resolution":{"observed_at":"2026-06-28T13:10:29.213917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20962","last_updated":"2024-12-17T07:13:38Z","snapshot_observed_at":"2026-08-04T06:32:40.653874Z","submitted_at":"2024-07-30T16:43:24Z","title":"MMTrail: A Multimodal Trailer Video Dataset with Language and Music Descriptions","version":3},"cited_work":{"arxiv_id":"2407.20962","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.20962","snapshot_observed_at":"2026-07-08T19:25:32.385591Z","title":"arXiv preprint arXiv:2407.20962 (2024)","venue":"cs.CV","work_id":"1d98bc56-fc6f-4549-b3fa-2a0d8fdb5778","year":2024},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"cited_paper":"/paper/2407.20962","citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:d30894811de274ae5623f58354aab94e5578cc2b0f5c155854fd5bd9b330b835","observation_id":"86268b62-024b-4408-829e-5de6a3adc9c4","resolution":{"observed_at":"2026-07-02T00:56:24.653940Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":"2210.13438","doi":"10.48550/arxiv.2210.13438","metadata_source":"pith","pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"High Fidelity Neural Audio Compression","venue":"eess.AS","work_id":"bc645d2d-e9f2-4cb8-9a6d-bd557bc7a258","year":2022},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:9b2c6e50c1140a1dca94389322395b63a3c4de490dc621f67d9e8b07a970b4f3","observation_id":"1ff7d939-01d1-4d2c-b0ad-ad1ab179f453","resolution":{"observed_at":"2026-07-02T00:56:24.679750Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:10:29.213917Z","title":"Video background music generation with controllable music transformer","venue":null,"work_id":null,"year":2037},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:490564e8cc1d5e71b4ebe3abcbae5229f016bc9620c834970c23b2c9fe882c8d","observation_id":"4249648a-a684-458f-8ea1-dd3417311a96","resolution":{"observed_at":"2026-06-28T13:10:29.213917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:10:29.213917Z","title":"Patrick Esser, Sumith Kulal, Andreas Blattmann, Rahim Entezari, Jonas M ¨uller, Harry Saini, Yam Levi, Dominik Lorenz, Axel Sauer, Frederic Boesel, et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:311c6f3d1ef964a567c01831cda4807016b2b4684ecd2553e09da1fafda2c8d2","observation_id":"a69dbd38-6052-4df7-a1a8-e5c018386d06","resolution":{"observed_at":"2026-06-28T13:10:29.213917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:10:29.213917Z","title":"Stable audio open","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:e519bec33bd290fb31dff5cff26aff94a370f46551e726211f40e139349c80b7","observation_id":"669cfe5f-3763-43f4-bc93-f419d6045d16","resolution":{"observed_at":"2026-06-28T13:10:29.213917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:10:29.213917Z","title":"Cot-vtm: Visual-to-music genera- tion with chain-of-thought reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:24f179ca313fe0e633212beefbc1765ab7e759cb11e0e23997d3de0b74567298","observation_id":"2a59da7a-3d8f-4cc7-bd24-1a26e710e76d","resolution":{"observed_at":"2026-06-28T13:10:29.213917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-02T16:58:30.102565Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":"2302.03917","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-07-08T00:04:22.608820Z","title":"Noise2music: Text-conditioned music generation with diffusion models","venue":"cs.SD","work_id":"c46cc447-8a7d-4123-bbdf-96b5571efcb6","year":2023},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:643a4e4227e57735775a02341a747e8803cf5e13a7f95403fcacd3d4b817a897","observation_id":"6703c3df-9d62-4e89-bec4-759e24a71161","resolution":{"observed_at":"2026-07-02T00:56:24.705379Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19611","last_updated":"2025-03-25T12:51:21Z","snapshot_observed_at":"2026-07-06T20:58:23.695292Z","submitted_at":"2025-03-25T12:51:21Z","title":"Analyzable Chain-of-Musical-Thought Prompting for High-Fidelity Music Generation","version":1},"cited_work":{"arxiv_id":"2503.19611","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.19611","snapshot_observed_at":"2026-07-08T00:04:22.520749Z","title":"Analyzable Chain-of-Musical-Thought Prompting for High-Fidelity Music Generation","venue":"cs.SD","work_id":"df0ddba0-6899-4e9c-a925-b7ac339e5405","year":2025},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"cited_paper":"/paper/2503.19611","citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:bab9bc04c17f52d484b3bae23db8aa2e5438d18c5cd593afa2a06efcb817bd53","observation_id":"a115c7fe-2aa2-4387-b9eb-865217e755bb","resolution":{"observed_at":"2026-07-02T00:56:24.670420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12957","last_updated":"2024-10-16T18:44:56Z","snapshot_observed_at":"2026-07-06T19:34:51.296918Z","submitted_at":"2024-10-16T18:44:56Z","title":"MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization","version":1},"cited_work":{"arxiv_id":"2410.12957","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.12957","snapshot_observed_at":"2026-07-03T13:28:18.797278Z","title":"Muvi: Video-to-music generation with se- mantic alignment and rhythmic synchronization,","venue":null,"work_id":"a5037c55-4fd9-42fa-a80f-ee23109dc0c5","year":2024},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"cited_paper":"/paper/2410.12957","citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:39d785c7bded6ce3d002aa239862c12986153f3310bafed1ff5b0aebaad25875","observation_id":"00bede47-b91c-4548-92a9-1b49e45abfc6","resolution":{"observed_at":"2026-07-02T00:56:24.684395Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:52e57be66176867f039755ab0c17cde2a237445e8a797e8840dd72e7752d628e","observation_id":"b92ffc5f-ce7e-4359-adff-675c846ee8a6","resolution":{"observed_at":"2026-07-02T00:56:24.660049Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06660","last_updated":"2024-12-09T16:59:35Z","snapshot_observed_at":"2026-08-03T13:30:52.953694Z","submitted_at":"2024-12-09T16:59:35Z","title":"MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models","version":1},"cited_work":{"arxiv_id":"2412.06660","doi":"10.48550/arxiv.2412.06660","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06660","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mumu-llama: Multi- modal music understanding and generation via large language models","venue":"arXiv (Cornell University)","work_id":"86e76775-33a2-445b-ab0d-a80ea3058812","year":2024},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"cited_paper":"/paper/2412.06660","citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:6f25a98c7434342960290aa2ccbc0ceb3749146d693e47bfd7d027357ebbc183","observation_id":"6f86704a-5c1a-4950-9d1b-daabb4d47bc4","resolution":{"observed_at":"2026-07-02T00:56:24.675619Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07594","last_updated":"2025-04-10T09:47:26Z","snapshot_observed_at":"2026-08-01T15:24:37.050491Z","submitted_at":"2025-04-10T09:47:26Z","title":"Extending Visual Dynamics for Video-to-Music Generation","version":1},"cited_work":{"arxiv_id":"2504.07594","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.07594","snapshot_observed_at":"2026-07-02T00:56:24.694093Z","title":"Extending visual dynamics for video-to- music generation.arXiv preprint arXiv:2504.07594,","venue":null,"work_id":"63c8669b-e2c9-48f4-a040-7f111c053a5a","year":null},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"cited_paper":"/paper/2504.07594","citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:87962dc0fa5d886890cc8f1c373ab6acf9c383c622607a5d050792597ab420cf","observation_id":"1e727a19-38b2-48e4-9157-e792c7716438","resolution":{"observed_at":"2026-07-02T00:56:24.696594Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08355","last_updated":"2024-06-03T07:56:23Z","snapshot_observed_at":"2026-08-04T13:20:17.468492Z","submitted_at":"2023-11-14T17:54:38Z","title":"Mustango: Toward Controllable Text-to-Music Generation","version":3},"cited_work":{"arxiv_id":"2311.08355","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.08355","snapshot_observed_at":"2026-07-08T00:04:22.335915Z","title":"Javier Nistal, Marco Pasini, Cyran Aouameur, Maarten Grachten, and Stefan Lattner","venue":"eess.AS","work_id":"b53744b6-7704-45b0-b3a3-af494d6f7c33","year":2023},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"cited_paper":"/paper/2311.08355","citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:084da4e53cbfcd65d927393c5948bd6fe5ab3d0958f1b66b6b6eb670f1edeba5","observation_id":"8b75afb5-e8bf-4f16-b92d-4f948b9b7f8d","resolution":{"observed_at":"2026-07-02T00:56:24.665422Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08384","last_updated":"2024-10-30T14:33:27Z","snapshot_observed_at":"2026-07-06T18:29:44.841845Z","submitted_at":"2024-06-12T16:34:26Z","title":"Diff-A-Riff: Musical Accompaniment Co-creation via Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":"2406.08384","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08384","snapshot_observed_at":"2026-07-02T00:56:24.697087Z","title":"Diff- a-riff: Musical accompaniment co-creation via latent diffusion models.arXiv preprint arXiv:2406.08384,","venue":null,"work_id":"b75e47e3-74bb-46d5-93f9-b55b60306de3","year":null},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"cited_paper":"/paper/2406.08384","citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:b98f2b513bea53e932159a2ff2288c6d386de55f339266eb8a7446ef5d4f053c","observation_id":"5ddaf623-e052-4bb6-b5c1-c152a59d9c27","resolution":{"observed_at":"2026-07-02T00:56:24.699439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20478","last_updated":"2024-10-27T15:35:41Z","snapshot_observed_at":"2026-07-31T01:59:01.480657Z","submitted_at":"2024-10-27T15:35:41Z","title":"MusicFlow: Cascaded Flow Matching for Text Guided Music Generation","version":1},"cited_work":{"arxiv_id":"2410.20478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20478","snapshot_observed_at":"2026-07-02T04:46:38.036343Z","title":"Musicflow: Cascaded flow matching for text guided music generation.arXiv preprint arXiv:2410.20478,","venue":null,"work_id":"28208c00-a9c6-4072-8316-0b072be8075e","year":2024},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"cited_paper":"/paper/2410.20478","citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:828b8df313e356c780b54885255f4987d23bf7a9b849ffe846db13b4ffab3f5e","observation_id":"3dd3d0e3-df57-4f0d-be46-a97a7bd64f5f","resolution":{"observed_at":"2026-07-02T00:56:24.701290Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:10:29.213917Z","title":"11 Preprint","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:416f4fe6c8d8b3b861d5a086cc6b01e95c58e268cdeb500978f4d5a0f3e328f1","observation_id":"576a224c-08a5-42c5-bb02-fa49935a6cad","resolution":{"observed_at":"2026-06-28T13:10:29.213917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10522","last_updated":"2026-04-15T16:32:32Z","snapshot_observed_at":"2026-07-31T02:51:01.521373Z","submitted_at":"2025-03-13T16:30:59Z","title":"AudioX: A Unified Framework for Anything-to-Audio Generation","version":4},"cited_work":{"arxiv_id":"2503.10522","doi":"10.48550/arxiv.2503.10522","metadata_source":"pith","pith_arxiv_id":"2503.10522","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"AudioX: A Unified Framework for Anything-to-Audio Generation","venue":"cs.MM","work_id":"ec79607c-bea2-4879-85ed-00db057adcc7","year":2025},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"cited_paper":"/paper/2503.10522","citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:c7547b4ad8817ad5a9a8cce3f08c4d8400ab81a934d31cf949071b4e3b1c0c2a","observation_id":"3f1586e7-f484-490f-b2f0-500017c520b1","resolution":{"observed_at":"2026-07-02T00:56:24.687730Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:10:29.213917Z","title":"Zhifeng Xie, Qile He, Youjia Zhu, Qiwei He, and Mengtian Li","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:07cbfe5c82be40897bc624cc2d6042bde25d76d92ac1511d37d3c7714237bdc1","observation_id":"652bcbd5-0627-42ba-aff6-1e6c2c274e90","resolution":{"observed_at":"2026-06-28T13:10:29.213917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:e75db7f2414e53eeb693bb8a032d9e25b68ffc8508f9aa21f1d4162e93d98d02","observation_id":"4a7d42f3-fa1e-4178-8676-8fdfaffcf970","resolution":{"observed_at":"2026-07-02T00:56:24.672571Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.08638","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:56:37.699753Z","title":"Yue: Scaling open foundation models for long-form music generation.arXiv:2503.08638","venue":null,"work_id":"d0baf14e-f5a5-426c-bc66-4abebd8513e5","year":2025},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:be59e8897945e70a4b8992b937adc97ec69a7b8e8a1eb19345eec90d0f92b90f","observation_id":"96e38a82-1309-41eb-b199-282bd09eb9ae","resolution":{"observed_at":"2026-07-02T00:56:24.668818Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":"2403.13372","doi":"10.48550/arxiv.2403.13372","metadata_source":"pith","pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","venue":"cs.CL","work_id":"462b3287-e058-48e3-b5e3-82a5f2a8dc06","year":2024},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:2eedbf6ddb2121956b2b89e80479cdf246fc3ae10e551555bb8ec3589026ca38","observation_id":"ef41e6cb-56ec-4f6c-94d8-4c1e4c9854ef","resolution":{"observed_at":"2026-07-02T00:56:24.687977Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04456","last_updated":"2023-09-21T09:30:00Z","snapshot_observed_at":"2026-08-04T15:52:56.827380Z","submitted_at":"2023-02-09T06:27:09Z","title":"ERNIE-Music: Text-to-Waveform Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":"2302.04456","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.04456","snapshot_observed_at":"2026-07-02T00:56:24.693313Z","title":"Ernie-music: Text-to-waveform music generation with diffusion models.arXiv preprint arXiv:2302.04456, 2023a","venue":null,"work_id":"6e590241-5409-479f-b00e-3cdd1613aaf2","year":null},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"cited_paper":"/paper/2302.04456","citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:99aafb358dffcfd8b88ced573ce5fd2a563e99888b028a6a95f37679a9316dd3","observation_id":"1d24e822-2186-49e3-8437-1816b78d467f","resolution":{"observed_at":"2026-07-02T00:56:24.695561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:10:29.213917Z","title":"A STATEMENTS ANDBROADERIMPACT A.1 ETHICSSTATEMENT Data Usage.Our work adheres to strict ethical guidelines regarding data usage","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:dbbe3cfc06f56d39b8a7816c4caef2a3481f7f5919ea99cbf4e5f1b929c7072e","observation_id":"a5839b60-8cfb-4de2-9e54-f3a868dd356e","resolution":{"observed_at":"2026-06-28T13:10:29.213917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:10:29.213917Z","title":"However, to facilitate further research and application, we will provide public API ac- cess to our foundational text-to-music model","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:da8e6fd904110c64bd5ab9fa50de4a0678da971db371c570b838056713abbc39","observation_id":"c3cc47e3-f7ff-4e62-97fb-53aaf2d62485","resolution":{"observed_at":"2026-06-28T13:10:29.213917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:10:29.213917Z","title":"This configuration allows us to partition long videos into a sequence of meaningful, temporally substantial clips suitable for individual soundtracking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:c770a6987e98023e72e5995686eaae0160584d0db85558f18668d70806fd8994","observation_id":"d13a7461-08e3-4ecf-a794-3e881f4ed1d9","resolution":{"observed_at":"2026-06-28T13:10:29.213917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:10:29.213917Z","title":"ground-truth","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:7cfce8f128e99272f049eae77b406891edac3f148a3d8aeeeb97c8fd0ba72a7e","observation_id":"6764d0ca-b4f1-4a3f-976f-d2f72346f71b","resolution":{"observed_at":"2026-06-28T13:10:29.213917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":11,"verified_exact":14,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2606.01703."}