{"as_of":"2026-08-08T21:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ff4a772bb5d09df9a78a619b7faed26802b2d469ed7e53eee1544bca4af4c453","coverage":[{"denominator":139,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T05:01:36.985927Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T21:25:26.928879Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-04T21:25:28.232250Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"cited_work":{"arxiv_id":"2509.05786","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.05786","snapshot_observed_at":"2026-08-04T21:25:28.232250Z","title":"Effectively obtaining acoustic, visual and textual data from videos","venue":"cs.MM","work_id":"a7b538d6-9014-487e-acad-ecee85090ce9","year":2025},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.928879Z"},"links":{"cited_paper":"/paper/2509.05786","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:ad80beda56b6a4a7c9b6d0f6c5f286765048b8e4a3ad7f9229ebf88050bed732","observation_id":"7f772987-5f54-46cf-9866-ec6efe4b5788","resolution":{"observed_at":"2026-08-04T21:25:28.242608Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.05786/citation-record","integrity":"/paper/2509.05786/integrity","json":"/paper/2509.05786/citation-record.json","paper":"/paper/2509.05786"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-05T05:01:36.507572Z","title":"Denk, Zal´ an Borsos, Jesse Engel, Mauro Verzetti, Antoine Caillon, Qingqing Huang, Aren Jansen, Adam Roberts, Marco Tagliasacchi, Matt Sharifi, Neil Zeghidour, and Christian Frank","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.507572Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:9ce6f2373eeb9beafb38692f3c60a0d1fe886e6dd805c39c2590d6cf65b46b61","observation_id":"ec8d8242-3b6f-423d-923a-7ebb9df55834","resolution":{"observed_at":"2026-08-05T05:01:36.507572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.513871Z","title":"Don’t Just Assume; Look and Answer: Overcoming Priors for Visual Question Answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.513871Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:f33bf8f62d0a5ffe5d0f993c6ac52d4a395d899aaf51e5b78615a3f36ac699ef","observation_id":"3cd07964-a3bb-4358-b095-78de3fdb81ea","resolution":{"observed_at":"2026-08-05T05:01:36.513871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.518771Z","title":"Mistral Models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.518771Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:ec831d97b7b60d994e88abac9e66e39a8284237263e19ce5e7740725ba9c812b","observation_id":"99c6f090-968f-400b-a719-1ec22b725617","resolution":{"observed_at":"2026-08-05T05:01:36.518771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.523453Z","title":"Transcripter- Generation of the transcript from audio to text using Deep Learning.International Journal of Computer Sciences and Engineering, 7(1):770–773, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.523453Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:1d22d786224c1d95fbe9b8130d3a9e23fcecba5a2f6e1464a9dc7f1b2ab0a0d6","observation_id":"372ebeb3-17cf-44e7-a93e-0f4d91613e8b","resolution":{"observed_at":"2026-08-05T05:01:36.523453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.528094Z","title":"The Claude 3 Model Family: Opus, Sonnet, Haiku, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.528094Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:c78ce800d11313f501dcbfeb0c9b0dee97c1fe5236e565bf2f1978a145a8239e","observation_id":"fc2a9b67-4ffb-489d-8878-eb742ee8314b","resolution":{"observed_at":"2026-08-05T05:01:36.528094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.532854Z","title":"SoundNet: Learning Sound Repre- sentations from Unlabeled Video","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.532854Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:b785ac8767ef61dba79a0ba660ff56043eebc02a662ec044397dd1eb7c07e8fc","observation_id":"e70fe5ab-2960-40f9-85db-628bf2a1f1c6","resolution":{"observed_at":"2026-08-05T05:01:36.532854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.538269Z","title":"Multimodal Language Analysis in the Wild: CMU-MOSEI Dataset and Interpretable Dynamic Fusion Graph","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.538269Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:3ab25d155c76074ec8762677c21eec00111ee308cd6d8c44ed4beb2aa609ab66","observation_id":"defe6cc8-1aa3-440e-b120-7fc94b5f0988","resolution":{"observed_at":"2026-08-05T05:01:36.538269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.544163Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Auto- mated Generation Pipeline with Large Audio and Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.544163Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:977d81ca60bd621c12ba12ca336933aea699f96ee2b925a87b1e3bfe12325ef9","observation_id":"316c0bbb-e9d0-480e-b692-35af49aa94d9","resolution":{"observed_at":"2026-08-05T05:01:36.544163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.548911Z","title":"Frozen in Time: A Joint Video and Image Encoder for End-to-End Retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.548911Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:50a2af7fba9495d962decbaeddd66cebcb6e2cf31725cf262338cbdb26ff906e","observation_id":"f4562230-9781-45e6-8bc2-4ce9ac26b683","resolution":{"observed_at":"2026-08-05T05:01:36.548911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.554025Z","title":"Are Mod- els Biased on Text without Gender-related Language? InProceedings of the 12th International Conference on Learning Representations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.554025Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:1c47f84094e03717776df14291e8306aa9694aa29bf6387bf286c6d44af8e702","observation_id":"6d290b8a-a6a8-458e-90a5-6fc08362aa87","resolution":{"observed_at":"2026-08-05T05:01:36.554025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.558715Z","title":"Ballester","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.558715Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:bdedd847dc3e0dd9c390e2479776576dce575fd8c21c6843cfb8580090fd5e86","observation_id":"03119dd8-0b6d-496a-b321-f8fee36243ba","resolution":{"observed_at":"2026-08-05T05:01:36.558715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.563846Z","title":"Improving Image Generation with Better Captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.563846Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:ca06d50f286d102c4161c07d226b4deb8b70aa7034ee8589b8a8e7c4a01752af","observation_id":"b28a154a-047f-41e8-bfa6-deb51104220b","resolution":{"observed_at":"2026-08-05T05:01:36.563846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00810","last_updated":"2023-09-02T03:27:20Z","snapshot_observed_at":"2026-08-04T08:54:36.402213Z","submitted_at":"2023-09-02T03:27:20Z","title":"RenAIssance: A Survey into AI Text-to-Image Generation in the Era of Large Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00810","snapshot_observed_at":"2026-08-05T05:01:36.568575Z","title":"Clifton, Yuxiong He, Dacheng Tao, and Shuaiwen Leon Song","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.568575Z"},"links":{"cited_paper":"/paper/2309.00810","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:a7a470a3363c700ec99cb07c21c9b8d6438dc60ee078ba1bfadd992d9f0aa370","observation_id":"2ec45e4e-f960-4ff1-b3ea-6aada080ed54","resolution":{"observed_at":"2026-08-05T05:01:36.568575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.573366Z","title":"Birhane and V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.573366Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:9b34e9743ca17fa96f326697b7b7a60b070b261974f19ab5777fb7b9c1ef9e64","observation_id":"02198a59-9a78-4616-90b4-f1440f833053","resolution":{"observed_at":"2026-08-05T05:01:36.573366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.577741Z","title":null,"venue":null,"work_id":null,"year":1958},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.577741Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:356053fdc16114db64ef8c303ad984c9d06dd7d81804be8cf8a8c34105d69d62","observation_id":"73c69020-6c12-4726-8872-7bfcaacb2a72","resolution":{"observed_at":"2026-08-05T05:01:36.577741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.582219Z","title":"Using acoustic indices in ecology: Guidance on study design, analyses and interpretation.Methods in Ecology and Evolution, 14(9):2192–2204, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.582219Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:d8f7d02ae77d940bf0a592ac0ece1f03fe205bad07f0b95a5fa11913b4e7cfed","observation_id":"ad5ee963-7aeb-41d9-9f81-57849769cf6a","resolution":{"observed_at":"2026-08-05T05:01:36.582219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.586717Z","title":"Bar- nett, Amy Beeston, Jennifer Darby, Benedict Dell, Nick Gardner, Amandine Gasc, Becky Heath, Nia Howells, Magnus Janson, Maria-Viktoria Kyoseva, Thomas Luy- paert, Oliver C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.586717Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:d377614f40f8c0ad9637d0d05a998cd713816e8d104f2c71983494a9d6b3d081","observation_id":"bd02f02c-f045-4923-9bf2-a8c0dcc8a0b3","resolution":{"observed_at":"2026-08-05T05:01:36.586717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.591285Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.591285Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:2e7d68503466026d82819e0c6e7175395b34b762ebb9e7c5d8cc22de2292b20d","observation_id":"d509692d-bf29-4afd-9c5a-4e0081b145cd","resolution":{"observed_at":"2026-08-05T05:01:36.591285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.595658Z","title":"Conceptual 12M: Pushing Web-Scale Image-Text Pre-Training To Recognize Long-Tail Visual Con- cepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.595658Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:d546206d3c3867a6c5c24cbaa21ac7c9bd588b227ad5de0ba7c5d8a0944e5a5e","observation_id":"c42c01c6-2259-40b2-8bf6-054b689513a7","resolution":{"observed_at":"2026-08-05T05:01:36.595658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-08T15:15:43.495121Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18851","snapshot_observed_at":"2026-08-05T05:01:36.599895Z","title":"Phantom-Data: Towards a General Subject-Consistent Video Generation Dataset.ArXiv, 2506.18851, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.599895Z"},"links":{"cited_paper":"/paper/2506.18851","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:2fefd08725e09efdd19f31d4d3ff3475585a04b4d86b2ec619cc34affbc33d17","observation_id":"a1f20d76-310a-4586-a321-85045de90fa4","resolution":{"observed_at":"2026-08-05T05:01:36.599895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.604495Z","title":"Veo, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.604495Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:e5fd08765dd2795e9812439a34e435ba435103ef007327938747d628a903a71c","observation_id":"f5cc86ea-68c2-4fc8-be17-1c99e942cdf4","resolution":{"observed_at":"2026-08-05T05:01:36.604495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.608792Z","title":"Central Limit Theorem in the Functional Approach.IEEE Transactions on Signal Processing, 61(16):4025–4037, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.608792Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:0dad775d0cfab788fbeb9fa155b272e2b323dd587358f73577f1588a13700616","observation_id":"6d80e0b5-c3f6-4668-94e8-56131c89436a","resolution":{"observed_at":"2026-08-05T05:01:36.608792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.613359Z","title":"A Survey of On-Device Machine Learning: An Algorithms and Learning Theory Perspective.ACM Transactions on Internet of Things, 2(3), 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.613359Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:06c5ff0cd92e9fd9a9f364e364e1cc15ec08533e9ca09c1b083ebe7a4b2a6589","observation_id":"b8407a28-33a6-4990-8995-1dc7dbda6f68","resolution":{"observed_at":"2026-08-05T05:01:36.613359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00341","last_updated":"2020-04-30T09:02:45Z","snapshot_observed_at":"2026-08-06T03:57:57.420510Z","submitted_at":"2020-04-30T09:02:45Z","title":"Jukebox: A Generative Model for Music","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00341","snapshot_observed_at":"2026-08-05T05:01:36.617814Z","title":"Jukebox: A Generative Model for Music.ArXiv, 2005.00341, 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.617814Z"},"links":{"cited_paper":"/paper/2005.00341","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:1229508c1a7d5ee9f529bd04401b2a185ad4a8bedfb6d2d10c12056bac26d1c9","observation_id":"8963eb35-2f12-492e-8765-595ec69aed77","resolution":{"observed_at":"2026-08-05T05:01:36.617814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T05:01:36.622952Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.622952Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:34772e26a73cd1a259d9bfa57a0d27071e890b603465653aa4ad26195f717cc9","observation_id":"1767255c-ec5e-4753-80da-4b32e29684a4","resolution":{"observed_at":"2026-08-05T05:01:36.622952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.628250Z","title":"Image Generation: A Review.Neural Processing Letters, 54(5):4609–4646, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.628250Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:10cb5b5ceea4eed19c144bab018e866620636075bf88b984731c173273943d69","observation_id":"31693e76-b8fc-4ca9-a1f6-a460b5f4697e","resolution":{"observed_at":"2026-08-05T05:01:36.628250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-05T05:01:36.632876Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.632876Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:ead64e7fbe65718bd1de92a28b18a60a4f7d86a801cbe56fcd3f076f5763e582","observation_id":"ca63f4b9-2338-4a79-9b2f-30cb1031323f","resolution":{"observed_at":"2026-08-05T05:01:36.632876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.02726","last_updated":"2025-02-13T12:12:28Z","snapshot_observed_at":"2026-08-02T22:12:00.951489Z","submitted_at":"2021-04-06T18:00:06Z","title":"Creativity and Machine Learning: A Survey","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.02726","snapshot_observed_at":"2026-08-05T05:01:36.637916Z","title":"Creativity and Machine Learning: A Survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.637916Z"},"links":{"cited_paper":"/paper/2104.02726","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:565a06279c625b50e55ab256557fa1adaa1c8a00b478e2b4b5a99a7d10829f1b","observation_id":"38f1b52f-fbff-4cd1-958c-05edc33f38c5","resolution":{"observed_at":"2026-08-05T05:01:36.637916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-05T05:01:36.642585Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling.ArXiv, 2101.00027, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.642585Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:5c4302db3e6ecf5e763207dc4b05bd9f1c2ec2fc2bc6291e47adeec88c0c2af5","observation_id":"b89344f3-fc01-4770-b056-cf9382f410a9","resolution":{"observed_at":"2026-08-05T05:01:36.642585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.04487","last_updated":"2020-03-28T04:53:38Z","snapshot_observed_at":"2026-08-05T14:27:51.315391Z","submitted_at":"2019-12-10T04:15:24Z","title":"Listen to Look: Action Recognition by Previewing Audio","version":3},"cited_work":{"arxiv_id":"1912.04487","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.04487","snapshot_observed_at":"2026-08-05T05:01:38.054791Z","title":"Listen to Look: Action Recognition by Previewing Audio","venue":"cs.CV","work_id":"160c0654-e2cd-45d2-a650-cf4f78efd666","year":2019},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.647072Z"},"links":{"cited_paper":"/paper/1912.04487","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:5eb88d4c8db8cd76c4afcc7de78fde5930c30285101e35e479fc02e963f788a6","observation_id":"2c00d998-a181-45f2-900c-f5f5773eb485","resolution":{"observed_at":"2026-08-05T05:01:38.060083Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.651713Z","title":"Gemmeke, Daniel P","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.651713Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:bfa5e5a6f003c6e07a60148121be968478c1830b4ad4f23da3c68ca5febe329d","observation_id":"6b0bc007-5648-4acb-a8c1-f6965de53a81","resolution":{"observed_at":"2026-08-05T05:01:36.651713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05665","last_updated":"2023-05-31T04:57:12Z","snapshot_observed_at":"2026-07-06T15:25:12.782361Z","submitted_at":"2023-05-09T17:59:07Z","title":"ImageBind: One Embedding Space To Bind Them All","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05665","snapshot_observed_at":"2026-08-05T05:01:36.656278Z","title":"ImageBind: One Embedding Space To Bind Them All.ArXiv, 2305.05665, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.656278Z"},"links":{"cited_paper":"/paper/2305.05665","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:b281154b3a81aea2fcb1bc432cef11f126b8a424eb25ff3fef4539ec07782128","observation_id":"cc9105c9-c3f9-462e-85db-995cc7d6b868","resolution":{"observed_at":"2026-08-05T05:01:36.656278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.661256Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.661256Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:d7487195eaf87c95595563644dbcd4fe85e79c866b2e2ce23cf5223823a9b01e","observation_id":"1d6d9822-6e67-4852-adcb-f8fbcddbb45e","resolution":{"observed_at":"2026-08-05T05:01:36.661256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-05T05:01:36.666271Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces.ArXiv, 2312.00752, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.666271Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:35f3cfb05f2b0be2fe523ff5c0a8be6f9430f55f1b6b6ef6f4e4afef0659d974","observation_id":"324a05e5-c1e6-4f91-a830-2717aba335bf","resolution":{"observed_at":"2026-08-05T05:01:36.666271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02968","last_updated":"2022-04-06T17:59:46Z","snapshot_observed_at":"2026-07-06T12:57:32.819460Z","submitted_at":"2022-04-06T17:59:46Z","title":"Temporal Alignment Networks for Long-term Video","version":1},"cited_work":{"arxiv_id":"2204.02968","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.02968","snapshot_observed_at":"2026-08-05T05:01:37.996544Z","title":"Temporal Alignment Networks for Long-term Video","venue":"cs.CV","work_id":"f31a44d1-9db4-4f10-8416-ae7dde930ba7","year":2022},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.671184Z"},"links":{"cited_paper":"/paper/2204.02968","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:6218210561cb753eda1e58496868e65a9efb53cf5394cdc6c3cf2d26bab42d3b","observation_id":"3ebed149-c399-4210-83ca-584ff496e8f1","resolution":{"observed_at":"2026-08-05T05:01:38.001715Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.677051Z","title":"Rae, and Laurent Sifre","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.677051Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:b74cf82a422e0b90f82151b472378ef7e7f6b600d38870ce556f006bc0d2b1f2","observation_id":"f68d5808-7bb5-4605-a3ca-809bfd1eb156","resolution":{"observed_at":"2026-08-05T05:01:36.677051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.681822Z","title":"Intuitive Multilingual Audio-Visual Speech Recognition with a Single-Trained Model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.681822Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:cf04f19b41db5c95e18da1864056ebb588b1575544958afa92d7be0ff14b559d","observation_id":"c08dc387-7c57-484b-95b9-115f89fbfe98","resolution":{"observed_at":"2026-08-05T05:01:36.681822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.686461Z","title":"Key Frame Selection for Temporal Graph Opti- mization of Skeleton-Based Action Recognition.Applied Sciences, 14(21), 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.686461Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:3b7133cb78f65ac387f87196b72d39e54e3ffa1bcd742ae9dbcf350c9a1394cc","observation_id":"1a400fbb-7282-4dcf-9cc2-f6a894c37edf","resolution":{"observed_at":"2026-08-05T05:01:36.686461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.691096Z","title":"NLIP: Noise-Robust Language-Image Pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.691096Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:bb77b39e3325da40da666e223076558aa2cdc0bb740eaa592c597a74fc677206","observation_id":"e2619ad0-e7db-43b4-b75d-10b811b3eb7e","resolution":{"observed_at":"2026-08-05T05:01:36.691096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.695555Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.695555Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:b6746f0c8a7eeb78aceb58da6e388301ed8a78187498735996443894cb8050f8","observation_id":"8030a54d-4642-4e07-ac9d-8312ffd4ec29","resolution":{"observed_at":"2026-08-05T05:01:36.695555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.700455Z","title":null,"venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.700455Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:04a9222ad266e0538474f912fe72678b3b2d84fae4e49834d89bf67a8c3bf385","observation_id":"d5b226b3-6510-48a0-9811-c9febbe51052","resolution":{"observed_at":"2026-08-05T05:01:36.700455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.705388Z","title":"LL VIP: A Visible- infrared Paired Dataset for Low-light Vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.705388Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:e202be697bf4b99d40e54225058c6b0463ad075f9618c089ed815d2c51e75804","observation_id":"947368cd-25dd-45e2-8879-1fd29ceb871a","resolution":{"observed_at":"2026-08-05T05:01:36.705388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11225","last_updated":"2022-11-21T07:40:01Z","snapshot_observed_at":"2026-08-05T21:35:06.193836Z","submitted_at":"2022-11-21T07:40:01Z","title":"TimbreCLIP: Connecting Timbre to Text and Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11225","snapshot_observed_at":"2026-08-05T05:01:36.709931Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.709931Z"},"links":{"cited_paper":"/paper/2211.11225","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:108a0d8ed79d829b95ac8366f5f0da0128f9dc28186836216e0c25082b1ec77a","observation_id":"93caa914-ba11-49d9-8659-e4964ef9e460","resolution":{"observed_at":"2026-08-05T05:01:36.709931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.714574Z","title":"Noise-Aware Learning from Web-Crawled Image-Text Data for Image Captioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.714574Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:0e308363c3ea7d2dbfca438f0791dcbcc6c23aa3f30d4b98e82bfca896af0efe","observation_id":"1f7baff1-df83-4c62-853a-066e913ca8a9","resolution":{"observed_at":"2026-08-05T05:01:36.714574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05980","last_updated":"2024-07-08T14:22:46Z","snapshot_observed_at":"2026-07-06T18:43:00.310399Z","submitted_at":"2024-07-08T14:22:46Z","title":"MMIS: Multimodal Dataset for Interior Scene Visual Generation and Recognition","version":1},"cited_work":{"arxiv_id":"2407.05980","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.05980","snapshot_observed_at":"2026-08-05T05:01:37.737102Z","title":"MMIS: Multimodal Dataset for Interior Scene Visual Generation and Recognition","venue":"cs.CV","work_id":"078afbd3-2fbc-4b70-aa2e-a965711ffdc9","year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.718947Z"},"links":{"cited_paper":"/paper/2407.05980","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:49fd75d1075c7393764a339953ad5ba976590d208bebc0dbed2a063db29cebad","observation_id":"78a115d0-1f88-48b5-ae44-df72cada4263","resolution":{"observed_at":"2026-08-05T05:01:37.742120Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.723724Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.723724Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:626186fe717f650faa0e0264cd9906046bef4bcfe65cb30f0a85e46ea49f1b67","observation_id":"5a4026dd-2113-40a0-9e48-6acf31061119","resolution":{"observed_at":"2026-08-05T05:01:36.723724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.728086Z","title":"AudioCaps: Generating Captions for Audios in The Wild","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.728086Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:60e08c532ef7b03e75c634f3377ba749faed8c3bd50b5ac7119905eebde1e122","observation_id":"bc087ea3-9c7c-48f1-bec4-ac70b048557b","resolution":{"observed_at":"2026-08-05T05:01:36.728086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-08-05T05:01:36.732735Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators.ArXiv, 2309.17012, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.732735Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:ccc06094c675658535a2ebacdc5c9945a48d3f76936a87f00eb2cd245e2b33d9","observation_id":"4e1e2dec-7704-4b8c-935e-200e8f2c817e","resolution":{"observed_at":"2026-08-05T05:01:36.732735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-07T16:54:38.689558Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T05:01:36.737476Z","title":"AudioGen: Textually Guided Audio Generation.ArXiv, 2209.15352, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.737476Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:e39bd7b4dd4711fca84aaa8840a75747eb223bc2f3da10b8e1b5420434e847a3","observation_id":"a1260ad0-06c3-4bd2-87ee-c4e0c0a3b362","resolution":{"observed_at":"2026-08-05T05:01:36.737476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.742843Z","title":"BindDiffusion: One Diffusion Model to Bind Them All, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.742843Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:af1ab1b5846498e2d19b90fc972ba79e2af842068cc39a7c03ca422157583a36","observation_id":"40ea535a-3d4a-45f8-96d2-14b38f8a8f55","resolution":{"observed_at":"2026-08-05T05:01:36.742843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.748006Z","title":"FLUX, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.748006Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:0a3585fcbec913a728288f6bf379ee27cad27fd94a9ad8cef348a19651b00d2b","observation_id":"e99ea385-2b6e-4480-b21e-ab166308de09","resolution":{"observed_at":"2026-08-05T05:01:36.748006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.752587Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.752587Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:20e1cc9fdd4a6f70a59dd83539c6616816501c1d883477e34cd19847b364fe93","observation_id":"0faaade5-8f3f-4af3-a586-0d186385b1ab","resolution":{"observed_at":"2026-08-05T05:01:36.752587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.756811Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.756811Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:1753d4f100bdef67bc7ab723f9b0e775ddb2276307f2f577b2eec09197ff9ed1","observation_id":"a61c7e02-bda4-4af6-9a4d-542b7246ea2c","resolution":{"observed_at":"2026-08-05T05:01:36.756811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.762891Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.762891Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:fc809c62139d60c4ecab1eb838d0aadc3f00c6f9a36fc1979461ff3662d17449","observation_id":"feb64b77-e522-4dca-b0aa-798fe3fb0323","resolution":{"observed_at":"2026-08-05T05:01:36.762891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.767567Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.767567Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:9771801d9702222c49294a3fd86c876e8c970aa02c89722061993b654d2d1fba","observation_id":"23acdd7b-6340-44a0-a435-65b815bff5fc","resolution":{"observed_at":"2026-08-05T05:01:36.767567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.772256Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.772256Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:6a984af70b0d6260a1ff9a9328218de2d518ed4e4f7a936922bfa3298dc53ba0","observation_id":"566fad45-6b69-461c-9233-29cfb1f62629","resolution":{"observed_at":"2026-08-05T05:01:36.772256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.777288Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.777288Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:2466c306e7eb7a3d37c02d2c6e501d7ca8bc630649543d6fb0f962539898daa6","observation_id":"61148e1b-803c-4613-b3ff-dd1dd8afa080","resolution":{"observed_at":"2026-08-05T05:01:36.777288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.781925Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.781925Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:895dd005ca90020a9ae1676e1545dff77971e0d36590f01ee85e13a783d177ad","observation_id":"5074745a-3fc1-4556-95af-4a061d8d6e5e","resolution":{"observed_at":"2026-08-05T05:01:36.781925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.786535Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.786535Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:7790de4b4fb3d05fe580194dedb9f042bad3936b796f25b5b7e83049bc886e49","observation_id":"dd476d19-c547-42a2-b863-03bd1bda0ba6","resolution":{"observed_at":"2026-08-05T05:01:36.786535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.791275Z","title":"OpenHumanVid: A Large-Scale High-Quality Dataset for Enhancing Human-Centric Video Generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.791275Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:b55633c5e9e83d9d574041f22479b3d6747272170420904aa37ca59d823aa00c","observation_id":"77b59946-7569-4cfe-8d9f-76164e9c046d","resolution":{"observed_at":"2026-08-05T05:01:36.791275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-05T05:01:36.796174Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Mod- els.ArXiv, 2301.12597, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.796174Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:23eaa58a89c03aa91f5141aa2b0cea94fc8d1923b44185e48c7064cd4b56096c","observation_id":"fc848145-e1df-42a1-9291-03dd77cb3ef1","resolution":{"observed_at":"2026-08-05T05:01:36.796174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-02T08:01:43.194717Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-05T05:01:36.801004Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Gen- eration.ArXiv, 2201.12086, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.801004Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:aca49792692648f456bba478e58330084597c2a99cfcb0930cacf280141c4d48","observation_id":"655e029f-4504-4828-b44b-460328908220","resolution":{"observed_at":"2026-08-05T05:01:36.801004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05500","last_updated":"2023-06-03T21:39:07Z","snapshot_observed_at":"2026-07-06T15:40:27.639368Z","submitted_at":"2023-06-03T21:39:07Z","title":"Word-Level Explanations for Analyzing Bias in Text-to-Image Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05500","snapshot_observed_at":"2026-08-05T05:01:36.805782Z","title":"Word-Level Explanations for Analyzing Bias in Text-to-Image Models.ArXiv, 2306.05500, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.805782Z"},"links":{"cited_paper":"/paper/2306.05500","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:4dd0039634eaaf56f5ba65349416362171e32a42cfc78cfadfcdf5e8d24106ee","observation_id":"02170d03-b9a9-48b0-9946-3de063dc4f0b","resolution":{"observed_at":"2026-08-05T05:01:36.805782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.810527Z","title":"Lawrence Zitnick","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.810527Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:aa4505d96353292355ed6e0cebf63a24c3f029f32207c17e213521f64a365391","observation_id":"bac5b7e1-71c3-425a-ad31-eb94a85b5459","resolution":{"observed_at":"2026-08-05T05:01:36.810527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.815034Z","title":"A Comparison Between KeyFrame Extraction Methods for Clothing Recognition, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.815034Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:025669e7ac4c3dbd32e08169fa5716ce7f086350557befb1ecc0d5b8d0bc22be","observation_id":"724e1ee9-d848-4c4b-99ea-2e5f3deec07c","resolution":{"observed_at":"2026-08-05T05:01:36.815034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.819846Z","title":"Plumbley","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.819846Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:c8a57c4f2698d7187e70c7cc40daf498e146b008dd777ec30b8caa57695841b3","observation_id":"3644ee48-de0c-47c8-bb57-9eed6a07f0d3","resolution":{"observed_at":"2026-08-05T05:01:36.819846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-05T05:01:36.824327Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models.ArXiv, 2402.17177, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.824327Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:c4e2b50cd03eb20e25d67beb13836d68b92d7f95d2499f68ac9c729a5fa82841","observation_id":"734295a9-b47e-49ef-a458-dffdfe7d8398","resolution":{"observed_at":"2026-08-05T05:01:36.824327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.829712Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.829712Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:bcfe58be6b82894b4340d12038a78ac723763dcdce2be27c06485d199d8ca497","observation_id":"ba28e53f-7947-48ae-8690-28f0e7e5beb0","resolution":{"observed_at":"2026-08-05T05:01:36.829712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.835254Z","title":"BLAP: Bootstrapping Language-Audio Pre-training for Music Captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.835254Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:38705d43c9f18fb18d70ef67725303215c4556c2bd48e952ccb97a1bb7bac76f","observation_id":"94c9feb5-863e-4d14-ba60-ec85cecbc01e","resolution":{"observed_at":"2026-08-05T05:01:36.835254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.840392Z","title":"Stable Diffusion Akashic Records, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.840392Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:e24dcdb04ddbbe716fadab76b6013da9f927726cf7c02da41c549eb340406085","observation_id":"e4fd3a40-1031-4c09-8502-3071e09ade49","resolution":{"observed_at":"2026-08-05T05:01:36.840392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18043","last_updated":"2024-10-30T20:16:18Z","snapshot_observed_at":"2026-07-06T18:37:04.753504Z","submitted_at":"2024-06-26T03:41:48Z","title":"GenRL: Multimodal-foundation world models for generalization in embodied agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18043","snapshot_observed_at":"2026-08-05T05:01:36.845122Z","title":"GenRL: Multimodal-foundation world models for generalization in embodied agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.845122Z"},"links":{"cited_paper":"/paper/2406.18043","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:9d1a4bfa8ba34598af3cc1dc09b71819a279b8ba3bb456393b0cb2f7d887052f","observation_id":"9af69ee2-41fc-4bb7-9a40-bea10e6dbff3","resolution":{"observed_at":"2026-08-05T05:01:36.845122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.849835Z","title":"Mustango: Toward Controllable Text-to-Music Generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.849835Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:6876747ad4325aedd74a7aa682f413675ba257e4edb6e5fd4a0e58c27597b2b9","observation_id":"dce89b1f-caf0-430f-a02a-6568fa5b4c7e","resolution":{"observed_at":"2026-08-05T05:01:36.849835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.854428Z","title":"Mukhamediev, Adilkhan Symagulov, Yan Kuchin, Kirill Yakunin, and Ma- rina Yelis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.854428Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:c307b7f3194181f51bca5409421135ccdeb264627c0562daecc25c9dbb8d6c46","observation_id":"e2bddc2e-62e9-4019-8434-618c75b22c38","resolution":{"observed_at":"2026-08-05T05:01:36.854428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.860309Z","title":"DALL·E 3 System Card, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.860309Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:11493c400cfa6dbbba11f6e83ce8880d7ac74a2185415f5ef4d3f30ba13447cd","observation_id":"95916d8e-de34-48b0-ba78-b829705542a5","resolution":{"observed_at":"2026-08-05T05:01:36.860309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.864946Z","title":"Video generation models as world simulators, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.864946Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:539594fcaba2de4066a0c2112780f569836065f6d21c66e4a2300cbd5e363d69","observation_id":"f1955f34-dc82-4f77-897c-572158524ffe","resolution":{"observed_at":"2026-08-05T05:01:36.864946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.869533Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.869533Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:78ff2ded1abc4cff3bc7b39dfe89738d5210ebb163ba9e1f0838d9d78852ee0b","observation_id":"232e3c2f-2a47-448c-ae2f-a304e18c9c82","resolution":{"observed_at":"2026-08-05T05:01:36.869533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.874061Z","title":"Image-to-Image Translation: Methods and Applications.IEEE Transactions on Multimedia, 24:3859–3881, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.874061Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:d2c791ee95368b8a4e1fe2b95b70198d267c785ad3046ba7cd164e85fc6289ed","observation_id":"42c840a9-50bc-43b6-9010-7f8bb454a298","resolution":{"observed_at":"2026-08-05T05:01:36.874061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.879208Z","title":"AudioSetZSL, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.879208Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:ebcbbdbc0e7b2d3c8c10bdde9d89e08b2e820c955f94b43b1dcdf14ecab135e2","observation_id":"071a64e6-495c-4522-bfe9-fbbd871374f7","resolution":{"observed_at":"2026-08-05T05:01:36.879208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.884006Z","title":"Coordi- nated Joint Multimodal Embeddings for Generalized Audio-Visual Zero-shot Classifi- cation and Retrieval of Videos","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.884006Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:56ae0ef17e5fb4b3d9d66fb429cbd4dccc5f5f5fd73b62f23afe197147e21593","observation_id":"2223b9a0-d786-4723-b199-03d5d455ed09","resolution":{"observed_at":"2026-08-05T05:01:36.884006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.888564Z","title":"Pijanowski, Luis J","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.888564Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:e376bb4ea00c51596411dc38765149eaf69ee78158754912db2767a3c2ba869a","observation_id":"4ccd66b9-3ce4-4bb6-8ba1-378cccafe673","resolution":{"observed_at":"2026-08-05T05:01:36.888564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.893458Z","title":"Plummer, Liwei Wang, Chris M","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.893458Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:1e141a59c21cd6d55e86f90d47f0890549ff5437c6091452768ef49b167af8ad","observation_id":"cbee204a-803b-4c13-bc2c-e870549cd3b2","resolution":{"observed_at":"2026-08-05T05:01:36.893458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-05T05:01:36.898253Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis.ArXiv, 2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.898253Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:77922bc70ce2f48feaccacf6b53d5f27915204a059781c999f021cf1f55bdf90","observation_id":"df676aed-bb72-4ac0-b295-29901731b91d","resolution":{"observed_at":"2026-08-05T05:01:36.898253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:38.717935Z","title":"Does mixing of speech signals comply with central limit theorem? International Journal of Electronics and Communications, 62(10):782–785, 2008","venue":null,"work_id":"b339f277-c176-4af5-a997-4bf05f7d0467","year":2008},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.903031Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:6d267e86439580a882cd95ee47cab467c03c9bbe4d8cc6b9c4ff866f0d71b753","observation_id":"d13fe9b0-f7e7-44bd-b383-7d52c3a1a9aa","resolution":{"observed_at":"2026-08-05T05:01:38.722935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.907592Z","title":"MirrorGAN: Learning Text-To-Image Generation by Redescription","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.907592Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:47a77c205a680a35c8d7beb4e0782811abefbab52ee4fe5bcd05fe4d09de8b2c","observation_id":"27f08d89-5358-4c74-84b1-f2cb26e6d60a","resolution":{"observed_at":"2026-08-05T05:01:36.907592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-05T05:01:36.912294Z","title":"Learning Transferable Visual Models From Natural Lan- guage Supervision.ArXiv, 2103.00020, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.912294Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:b1321a47dae383e9044551129fe70f9c4de93e38b8f7eba66908432971beae2a","observation_id":"e3c07864-0d86-489c-95ab-81798b370b51","resolution":{"observed_at":"2026-08-05T05:01:36.912294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.917064Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.917064Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:6e00c675e45198a774dd390cb7fe237ffe75db83ecea41efcbf22c757df75381","observation_id":"aedb676f-01de-41a3-996e-a5061d3e48ee","resolution":{"observed_at":"2026-08-05T05:01:36.917064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T05:01:36.921533Z","title":"Zero-Shot Text-to-Image Generation.ArXiv, 2102.12092, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.921533Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:cf2aef9b81d2640db69e9f8623c32db57ebffe1c15fa2975739c56e7449ec8ed","observation_id":"87d9060f-42ac-4c74-b9f8-de95ef1ef747","resolution":{"observed_at":"2026-08-05T05:01:36.921533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T05:01:36.926838Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.926838Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:11aea819063d5ba21bc07901178b07f76f84e66409bfd0ece9ada90f2ab299cc","observation_id":"f0de62db-f4ac-4b36-87d6-36ac83a0c53d","resolution":{"observed_at":"2026-08-05T05:01:36.926838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:38.678450Z","title":"Stable Diffusion, 2021","venue":null,"work_id":"ea804046-b881-4efd-b41d-999bfc4aef6b","year":2021},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.932052Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:053c1ef61a7518ce199620f2d5cb8905f2f07df398d8212e6b1c25948ea6c039","observation_id":"becfe866-8825-413b-8892-eb51594631fe","resolution":{"observed_at":"2026-08-05T05:01:38.683239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-05T05:01:36.937443Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models.ArXiv, 2112.10752, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.937443Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:cc7706f8adc82d54451dd391f205768087d701e50c67f9544565c55139c80819","observation_id":"0465db97-e607-4ada-a9ba-331eec2aa695","resolution":{"observed_at":"2026-08-05T05:01:36.937443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.942534Z","title":"Introducing Gen-3 Alpha: A New Frontier for Video Generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.942534Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:82a7a7bfb67c419575d9aa741ababfe346ed666cb9d69c5971550f61268d315f","observation_id":"8e505e95-660f-4781-bda9-a9e2b108ebb9","resolution":{"observed_at":"2026-08-05T05:01:36.942534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.947834Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.947834Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:cf034c1f5a9d26d9769bce1b4c583435a26c335cde7bc9d87a0e6bce767ceef6","observation_id":"74544f37-caf6-4c0a-ba80-96e6065ba4e1","resolution":{"observed_at":"2026-08-05T05:01:36.947834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:38.639404Z","title":"ActionAtlas: A VideoQA Benchmark for Domain-specialized Action Recognition","venue":null,"work_id":"4ae48b83-5c12-4ccb-bf33-5a149e414f32","year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.953007Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:7a5693de35d8eea9d4d4f03220a745f2da734243e105e220796818feb46d6453","observation_id":"3fd18f94-87ce-447f-86a3-1f94f9743bd8","resolution":{"observed_at":"2026-08-05T05:01:38.644398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.12625","last_updated":"2022-08-27T00:32:29Z","snapshot_observed_at":"2026-08-05T20:20:01.535124Z","submitted_at":"2021-12-23T15:11:18Z","title":"Comparison and Analysis of Image-to-Image Generative Adversarial Networks: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.12625","snapshot_observed_at":"2026-08-05T05:01:36.957524Z","title":"Comparison and Analysis of Image-to- Image Generative Adversarial Networks: A Survey.ArXiv, 2112.12625, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.957524Z"},"links":{"cited_paper":"/paper/2112.12625","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:b7f540af717c2a2741287e795f8dedc05c1e1115d47e1d8ef2b675920f288680","observation_id":"6c2abd28-5c1e-43b3-abfb-6a13cf33016d","resolution":{"observed_at":"2026-08-05T05:01:36.957524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:38.623370Z","title":"What is noise?Geophysics, 63(4):1122–1124, 1998","venue":null,"work_id":"572df751-90eb-4b60-a12b-2367ad0929e4","year":1998},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.962343Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:48f647effebf2565ec9c1edf3c8e969a32ea119e39f5472c70d9d478d30c3cee","observation_id":"1e99fdc3-62d6-4ba8-beb5-859e76015007","resolution":{"observed_at":"2026-08-05T05:01:38.628464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:38.606442Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"feda3e4e-8d6a-4f8d-812a-5a90201d2a0e","year":2022},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.967095Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:9ce07455c79f1b3d3802fc8d7b6af7287bbc548334a6302d259fb5843354138c","observation_id":"f86c7b08-e085-4929-a849-b350da166928","resolution":{"observed_at":"2026-08-05T05:01:38.612113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-05T05:01:36.971628Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs.ArXiv, 2111.02114, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.971628Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:38dc04e8b6d95be1f97e9feda8f9f02072cd80c7f229e01a2a02dfa8ad028d32","observation_id":"1141ad1b-87bf-4cf4-8205-39e917d797f9","resolution":{"observed_at":"2026-08-05T05:01:36.971628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:01:36.976501Z","title":null,"venue":null,"work_id":null,"year":1948},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.976501Z"},"links":{"citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:c961d682cf1d15216a9800c73e50c2dc20d4d156cd9c7dd307c047bf35c8f00b","observation_id":"181fc8f0-d346-40ef-867e-3e508f577b82","resolution":{"observed_at":"2026-08-05T05:01:36.976501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.03089","last_updated":"2023-02-27T11:15:40Z","snapshot_observed_at":"2026-07-06T14:14:57.954649Z","submitted_at":"2022-11-06T11:48:20Z","title":"I Hear Your True Colors: Image Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.03089","snapshot_observed_at":"2026-08-05T05:01:36.981088Z","title":"I Hear Your True Colors: Image Guided Audio Generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.981088Z"},"links":{"cited_paper":"/paper/2211.03089","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:07aeefd53d26e3ad393810f9b3b3107f7ba20c7294d3e05ab0a291caa2f6c7de","observation_id":"7bae9aa2-c149-499e-a4ec-8a463198ecb6","resolution":{"observed_at":"2026-08-05T05:01:36.981088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.00443","last_updated":"2021-08-01T12:35:16Z","snapshot_observed_at":"2026-08-08T06:46:37.705481Z","submitted_at":"2021-08-01T12:35:16Z","title":"A Survey on Audio Synthesis and Audio-Visual Multimodal Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.00443","snapshot_observed_at":"2026-08-05T05:01:36.985927Z","title":"A Survey on Audio Synthesis and Audio-Visual Multimodal Processing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.985927Z"},"links":{"cited_paper":"/paper/2108.00443","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:1387ce53b0f862c8ba1d9ebca40d7e11deb51fa2fbc8b6c48558cc8384af85c9","observation_id":"b956306a-aaff-4ab1-bd9c-34721c77bd74","resolution":{"observed_at":"2026-08-05T05:01:36.985927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":92,"verified_exact":3,"verified_fuzzy":5},"total_outbound_references":139},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 139 outbound references and 1 inbound Pith citation observation for arXiv:2509.05786."}