{"as_of":"2026-08-23T04:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:952c0a5e24014d12a4cf01c3b0838e859cfdaf6293d5a37bd366e3e63530c2f8","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-08T19:18:56.334254Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.05971/citation-record","integrity":"/paper/2607.05971/integrity","json":"/paper/2607.05971/citation-record.json","paper":"/paper/2607.05971"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2607.05971","last_updated":"2026-07-07T08:04:56Z","snapshot_observed_at":"2026-08-13T02:50:42.238623Z","submitted_at":"2026-07-07T08:04:56Z","title":"Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-08T19:18:56.334254Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.05971"},"observation_digest":"sha256:ce0acc4e15fbd51e4eb0b70ea72f80407501ebc351045557e3951890fd4e378d","observation_id":"259b61b3-d44e-4231-bb7a-c2add02cbdb5","resolution":{"observed_at":"2026-07-08T19:25:32.389946Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-16T18:24:53.899867Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"cited_work":{"arxiv_id":"2509.04215","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.04215","snapshot_observed_at":"2026-07-08T19:25:32.403339Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","venue":"cs.SD","work_id":"af58e947-97d2-4a6a-b721-476a0cb9f952","year":2025},"citing_paper":{"arxiv_id":"2607.05971","last_updated":"2026-07-07T08:04:56Z","snapshot_observed_at":"2026-08-13T02:50:42.238623Z","submitted_at":"2026-07-07T08:04:56Z","title":"Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-08T19:18:56.334254Z"},"links":{"cited_paper":"/paper/2509.04215","citing_paper":"/paper/2607.05971"},"observation_digest":"sha256:5471ec73f56d6ef2cf622270a9ce8a50acd2b19d13f88e25b8100768ee968c88","observation_id":"7ebe0395-9509-48d8-92db-6cd7385b7699","resolution":{"observed_at":"2026-07-08T19:25:32.404599Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20962","last_updated":"2024-12-17T07:13:38Z","snapshot_observed_at":"2026-08-16T13:29:48.528252Z","submitted_at":"2024-07-30T16:43:24Z","title":"MMTrail: A Multimodal Trailer Video Dataset with Language and Music Descriptions","version":3},"cited_work":{"arxiv_id":"2407.20962","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.20962","snapshot_observed_at":"2026-07-08T19:25:32.385591Z","title":"arXiv preprint arXiv:2407.20962 (2024)","venue":"cs.CV","work_id":"1d98bc56-fc6f-4549-b3fa-2a0d8fdb5778","year":2024},"citing_paper":{"arxiv_id":"2607.05971","last_updated":"2026-07-07T08:04:56Z","snapshot_observed_at":"2026-08-13T02:50:42.238623Z","submitted_at":"2026-07-07T08:04:56Z","title":"Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-08T19:18:56.334254Z"},"links":{"cited_paper":"/paper/2407.20962","citing_paper":"/paper/2607.05971"},"observation_digest":"sha256:9e1252218a147647fcd6093dcc05ce52e4a1ba82473344e58661e4d4b33d76de","observation_id":"e97f020d-7ff6-49d1-bfc2-b5c8bb65b8ab","resolution":{"observed_at":"2026-07-08T19:25:32.386908Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.01893","last_updated":"2021-07-27T19:23:41Z","snapshot_observed_at":"2026-08-17T12:02:54.612074Z","submitted_at":"2021-03-02T17:45:04Z","title":"Listen, Read, and Identify: Multimodal Singing Language Identification of Music","version":4},"cited_work":{"arxiv_id":"2103.01893","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.01893","snapshot_observed_at":"2026-07-08T19:25:32.391363Z","title":"Listen, Read, and Identify: Multimodal Singing Language Identification of Music","venue":"cs.SD","work_id":"acde13c7-7d00-469b-aa07-761c45f82b4b","year":2021},"citing_paper":{"arxiv_id":"2607.05971","last_updated":"2026-07-07T08:04:56Z","snapshot_observed_at":"2026-08-13T02:50:42.238623Z","submitted_at":"2026-07-07T08:04:56Z","title":"Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-08T19:18:56.334254Z"},"links":{"cited_paper":"/paper/2103.01893","citing_paper":"/paper/2607.05971"},"observation_digest":"sha256:caaa4111d39ce9cea687419942404e4e9ee11aadaea2d2eb21c6050cae82e047","observation_id":"0f43de9d-3a28-49f7-bcda-b161e1b38bc6","resolution":{"observed_at":"2026-07-08T19:25:32.392550Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16372","last_updated":"2023-07-31T02:32:02Z","snapshot_observed_at":"2026-08-16T15:12:06.867651Z","submitted_at":"2023-07-31T02:32:02Z","title":"LP-MusicCaps: LLM-Based Pseudo Music Captioning","version":1},"cited_work":{"arxiv_id":"2307.16372","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16372","snapshot_observed_at":"2026-07-08T19:25:32.407848Z","title":"Lp-musiccaps: Llm-based pseudo music captioning","venue":"cs.SD","work_id":"bee63e50-4471-4228-8887-79c704a06b8f","year":2023},"citing_paper":{"arxiv_id":"2607.05971","last_updated":"2026-07-07T08:04:56Z","snapshot_observed_at":"2026-08-13T02:50:42.238623Z","submitted_at":"2026-07-07T08:04:56Z","title":"Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-08T19:18:56.334254Z"},"links":{"cited_paper":"/paper/2307.16372","citing_paper":"/paper/2607.05971"},"observation_digest":"sha256:b50b006557d1e86920b01b861a3639fdc214cfdd0187365a074eeabe1334119d","observation_id":"62e5769b-1db1-4242-b4a5-304f1d3eec2a","resolution":{"observed_at":"2026-07-08T19:25:32.409284Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13713","last_updated":"2026-06-02T09:14:11Z","snapshot_observed_at":"2026-08-16T12:56:59.923512Z","submitted_at":"2025-02-19T13:28:20Z","title":"TALKPLAY: Multimodal Music Recommendation with Large Language Models","version":5},"cited_work":{"arxiv_id":"2502.13713","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.13713","snapshot_observed_at":"2026-07-08T19:25:32.413509Z","title":"Talkplay: Multimodal music recommendation with large language models","venue":"cs.IR","work_id":"7489cfe4-ff26-4e72-affe-c9b055f66ed6","year":2025},"citing_paper":{"arxiv_id":"2607.05971","last_updated":"2026-07-07T08:04:56Z","snapshot_observed_at":"2026-08-13T02:50:42.238623Z","submitted_at":"2026-07-07T08:04:56Z","title":"Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-08T19:18:56.334254Z"},"links":{"cited_paper":"/paper/2502.13713","citing_paper":"/paper/2607.05971"},"observation_digest":"sha256:02a0446a66e6259105898090cd891a81ca83ad91aec5c2b2ec0f9c2fb1563d5b","observation_id":"df24de1f-78d8-4daf-97ae-00ce9be4a859","resolution":{"observed_at":"2026-07-08T19:25:32.416406Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.10289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:25:32.410532Z","title":"Music Flamingo: Scaling music understanding in audio language models","venue":null,"work_id":"686b6882-e08a-42fb-8aa1-3091508afd72","year":2026},"citing_paper":{"arxiv_id":"2607.05971","last_updated":"2026-07-07T08:04:56Z","snapshot_observed_at":"2026-08-13T02:50:42.238623Z","submitted_at":"2026-07-07T08:04:56Z","title":"Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-08T19:18:56.334254Z"},"links":{"citing_paper":"/paper/2607.05971"},"observation_digest":"sha256:d22fe7005084af99426733d8bcf5942f51dd26dd8584c5fd3270b04b8b35dfcf","observation_id":"106044c0-c970-42c3-b7b0-55d5f5e293d5","resolution":{"observed_at":"2026-07-08T19:25:32.412044Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T21:15:39.623064Z","title":"Audioclip: Extending clip to image, text and audio","venue":null,"work_id":"a61a67cb-b438-44ec-8bf7-bd54a6e12c35","year":2022},"citing_paper":{"arxiv_id":"2607.05971","last_updated":"2026-07-07T08:04:56Z","snapshot_observed_at":"2026-08-13T02:50:42.238623Z","submitted_at":"2026-07-07T08:04:56Z","title":"Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-08T19:18:56.334254Z"},"links":{"citing_paper":"/paper/2607.05971"},"observation_digest":"sha256:39c167f86e26d701af3f67977f7b0cd7b20c3b1a6ba6b60ec64cf1e81952484f","observation_id":"11b251ca-0c62-4049-bc12-f094ec43e4bc","resolution":{"observed_at":"2026-07-08T21:15:39.624144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.01969","last_updated":"2020-03-25T22:53:51Z","snapshot_observed_at":"2026-08-19T14:39:36.349853Z","submitted_at":"2019-04-22T02:18:00Z","title":"Poly-encoders: Transformer Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring","version":4},"cited_work":{"arxiv_id":"1905.01969","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.01969","snapshot_observed_at":"2026-07-08T19:25:32.393718Z","title":"Poly-encoders: Transformer architectures and pre-training strategies for fast and accurate multi-sentence scoring","venue":"cs.CL","work_id":"f03a4a99-61cd-4d39-a94e-91a35e3e65e8","year":2019},"citing_paper":{"arxiv_id":"2607.05971","last_updated":"2026-07-07T08:04:56Z","snapshot_observed_at":"2026-08-13T02:50:42.238623Z","submitted_at":"2026-07-07T08:04:56Z","title":"Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-08T19:18:56.334254Z"},"links":{"cited_paper":"/paper/1905.01969","citing_paper":"/paper/2607.05971"},"observation_digest":"sha256:0c246adb982b9e8d3887cb0e58b436e1293bb59c7ebe4e567959a6361e58c4d4","observation_id":"63d8c160-3af7-4b67-911a-0382a29a9226","resolution":{"observed_at":"2026-07-08T19:25:32.394949Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21337","last_updated":"2026-01-30T02:58:48Z","snapshot_observed_at":"2026-08-13T02:49:58.912820Z","submitted_at":"2026-01-29T06:58:13Z","title":"Qwen3-ASR Technical Report","version":2},"cited_work":{"arxiv_id":"2601.21337","doi":"10.48550/arxiv.2601.21337","metadata_source":"pith","pith_arxiv_id":"2601.21337","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-ASR Technical Report","venue":"cs.CL","work_id":"db50e258-4a3d-4141-ba30-f76f8f953880","year":2026},"citing_paper":{"arxiv_id":"2607.05971","last_updated":"2026-07-07T08:04:56Z","snapshot_observed_at":"2026-08-13T02:50:42.238623Z","submitted_at":"2026-07-07T08:04:56Z","title":"Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-08T19:18:56.334254Z"},"links":{"cited_paper":"/paper/2601.21337","citing_paper":"/paper/2607.05971"},"observation_digest":"sha256:3db07e5baf9a028bfdd2b1c3e746b6a19de3f9215d0fe1c3b72587958e09ae84","observation_id":"24cca5ac-b8cd-433b-a52c-17b234aa06ae","resolution":{"observed_at":"2026-07-08T19:25:32.397341Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-08-20T12:00:11.254046Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"cited_work":{"arxiv_id":"2502.05139","doi":"10.48550/arxiv.2502.05139","metadata_source":"pith","pith_arxiv_id":"2502.05139","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","venue":"cs.SD","work_id":"7cba92d8-f51e-4a64-8d1d-6d4cf1f56377","year":2025},"citing_paper":{"arxiv_id":"2607.05971","last_updated":"2026-07-07T08:04:56Z","snapshot_observed_at":"2026-08-13T02:50:42.238623Z","submitted_at":"2026-07-07T08:04:56Z","title":"Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-08T19:18:56.334254Z"},"links":{"cited_paper":"/paper/2502.05139","citing_paper":"/paper/2607.05971"},"observation_digest":"sha256:8fdca03617fea9387d9571d064280e0a49d3055bee43bdab46b533c8d61e9b8d","observation_id":"54100690-59be-4a42-be60-535360c2eac1","resolution":{"observed_at":"2026-07-08T19:25:32.401997Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2607.05971","last_updated":"2026-07-07T08:04:56Z","snapshot_observed_at":"2026-08-13T02:50:42.238623Z","submitted_at":"2026-07-07T08:04:56Z","title":"Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-08T19:18:56.334254Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2607.05971"},"observation_digest":"sha256:7ed92c923efaa08eca3bbdd28d34638e76fc2cf2ecfafbb0e96f1f75cc6b4eb5","observation_id":"6446a29d-988b-4712-9e70-91a565430759","resolution":{"observed_at":"2026-07-08T19:25:32.419925Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.19687","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:25:32.421602Z","title":"Pushing the frontier of audiovisual perception with large-scale multimodal correspondence learning","venue":null,"work_id":"919a71a1-0345-490b-9930-9cc5741e9a6e","year":2025},"citing_paper":{"arxiv_id":"2607.05971","last_updated":"2026-07-07T08:04:56Z","snapshot_observed_at":"2026-08-13T02:50:42.238623Z","submitted_at":"2026-07-07T08:04:56Z","title":"Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-08T19:18:56.334254Z"},"links":{"citing_paper":"/paper/2607.05971"},"observation_digest":"sha256:fda5c5a3850b434b3d128f81183f6c856edea8a40d5521ff47e70746560caa28","observation_id":"f3493831-43e7-471f-b24c-1c4ba103c559","resolution":{"observed_at":"2026-07-08T19:25:32.423599Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T21:15:39.619963Z","title":null,"venue":null,"work_id":"fcb08771-4228-4033-a9e8-84c8aa2aa54e","year":2022},"citing_paper":{"arxiv_id":"2607.05971","last_updated":"2026-07-07T08:04:56Z","snapshot_observed_at":"2026-08-13T02:50:42.238623Z","submitted_at":"2026-07-07T08:04:56Z","title":"Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-08T19:18:56.334254Z"},"links":{"citing_paper":"/paper/2607.05971"},"observation_digest":"sha256:1ab0fcf73bf6a2199534d2ec62daab6156a2b331577293cb58c6d2df27d9ecce","observation_id":"93fc22e5-8c88-4a8e-8711-d2b5fcc2d0e9","resolution":{"observed_at":"2026-07-08T21:15:39.620897Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10362","last_updated":"2025-05-18T16:25:19Z","snapshot_observed_at":"2026-08-18T09:59:07.101054Z","submitted_at":"2025-02-14T18:42:25Z","title":"CLaMP 3: Universal Music Information Retrieval Across Unaligned Modalities and Unseen Languages","version":3},"cited_work":{"arxiv_id":"2502.10362","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.10362","snapshot_observed_at":"2026-07-08T19:25:32.424980Z","title":"Clamp 3: Universal music information retrieval across unaligned modalities and unseen languages","venue":"cs.SD","work_id":"ec4d0f01-f52d-4440-bf6f-bced08296fc7","year":2025},"citing_paper":{"arxiv_id":"2607.05971","last_updated":"2026-07-07T08:04:56Z","snapshot_observed_at":"2026-08-13T02:50:42.238623Z","submitted_at":"2026-07-07T08:04:56Z","title":"Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-08T19:18:56.334254Z"},"links":{"cited_paper":"/paper/2502.10362","citing_paper":"/paper/2607.05971"},"observation_digest":"sha256:7821ebdffbf4bba380de6bc727fecd05a6a2760e9f866a43e340e7248a0a31eb","observation_id":"40586d8e-e555-4f52-864b-102e45a0dc0a","resolution":{"observed_at":"2026-07-08T19:25:32.428257Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2607.05971","last_updated":"2026-07-07T08:04:56Z","snapshot_observed_at":"2026-08-13T02:50:42.238623Z","submitted_at":"2026-07-07T08:04:56Z","title":"Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-08T19:18:56.334254Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.05971"},"observation_digest":"sha256:f703a9fbe6eab9b82989e26a4656668035acbaaf984714f1d9c611084a876aa3","observation_id":"c1a56a38-f603-44a6-a0c4-d078f2299d2f","resolution":{"observed_at":"2026-07-08T19:25:32.432408Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07597","last_updated":"2024-09-24T03:01:25Z","snapshot_observed_at":"2026-08-18T00:19:33.067213Z","submitted_at":"2023-09-14T10:57:50Z","title":"C-Pack: Packed Resources For General Chinese Embeddings","version":5},"cited_work":{"arxiv_id":"2309.07597","doi":"10.48550/arxiv.2309.07597","metadata_source":"pith","pith_arxiv_id":"2309.07597","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C-Pack: Packed Resources For General Chinese Embeddings","venue":"cs.CL","work_id":"5d8d3efd-bb5b-4a30-8457-28f190c026e9","year":2023},"citing_paper":{"arxiv_id":"2607.05971","last_updated":"2026-07-07T08:04:56Z","snapshot_observed_at":"2026-08-13T02:50:42.238623Z","submitted_at":"2026-07-07T08:04:56Z","title":"Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-08T19:18:56.334254Z"},"links":{"cited_paper":"/paper/2309.07597","citing_paper":"/paper/2607.05971"},"observation_digest":"sha256:27fbaabe148981c7fc6c6095a05307f1a7f2fdffc967264cb2db0523f503b8f3","observation_id":"afb22485-52a9-41b0-8329-d4f9cdbb7685","resolution":{"observed_at":"2026-07-08T19:25:32.438058Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T21:15:39.621407Z","title":"Languagebind: Extending video-language pretraining to n-modality by language-based semantic alignment","venue":null,"work_id":"9331075f-e50a-4df6-bc65-d92c02aeb276","year":2024},"citing_paper":{"arxiv_id":"2607.05971","last_updated":"2026-07-07T08:04:56Z","snapshot_observed_at":"2026-08-13T02:50:42.238623Z","submitted_at":"2026-07-07T08:04:56Z","title":"Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-08T19:18:56.334254Z"},"links":{"citing_paper":"/paper/2607.05971"},"observation_digest":"sha256:c48363f131f61753776791ef95d1edf502c4fcda77478d558599500abecb22ad","observation_id":"00597ec6-990a-441e-9ce9-3dc155acaa75","resolution":{"observed_at":"2026-07-08T21:15:39.622530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.05971","last_updated":"2026-07-07T08:04:56Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-13T02:50:42.238623Z","submitted_at":"2026-07-07T08:04:56Z","title":"Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":1,"verified_exact":12,"verified_fuzzy":2},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2607.05971."}