{"as_of":"2026-08-10T10:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:26c5dd52a1255839db3a1d2c6ca7cf3790ab52f85db122af8d58949e12fd59fe","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T00:46:08.276886Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:41:39.719320Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T17:53:11.781235Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18096","snapshot_observed_at":"2026-08-07T10:41:39.719320Z","title":"Zijian Dong, Xu Chen, Jinlong Yang, Michael J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-08T04:59:52.537136Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.719320Z"},"links":{"cited_paper":"/paper/2501.18096","citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:a766851a20732e389a2fb0aded91223a9266ae08c774089d181183188a0b0fad","observation_id":"07f8e3c3-0c4b-49da-9c4b-4fc59bc741a6","resolution":{"observed_at":"2026-08-07T10:41:39.719320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18096","snapshot_observed_at":"2026-08-05T20:49:43.276306Z","title":"Llms can see and hear without any training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09968","last_updated":"2025-08-13T17:33:37Z","snapshot_observed_at":"2026-08-09T16:12:37.857462Z","submitted_at":"2025-08-13T17:33:37Z","title":"Noise Hypernetworks: Amortizing Test-Time Compute in Diffusion Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T20:49:43.276306Z"},"links":{"cited_paper":"/paper/2501.18096","citing_paper":"/paper/2508.09968"},"observation_digest":"sha256:c81edd9b88602af53cd1a94e509bdbbde7d0d25114914e08ef0e85d9bc235175","observation_id":"234690bb-8c5c-4572-865e-afc404bf07a3","resolution":{"observed_at":"2026-08-05T20:49:43.276306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"cited_work":{"arxiv_id":"2501.18096","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18096","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llms can see and hear without any training","venue":null,"work_id":"647a1037-36ec-47f9-9a2a-ae5778211d92","year":2025},"citing_paper":{"arxiv_id":"2601.00090","last_updated":"2026-05-01T04:44:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-31T19:47:49Z","title":"It's Never Too Late: Noise Optimization for Collapse Recovery in Trained Diffusion Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T17:51:32.439732Z"},"links":{"cited_paper":"/paper/2501.18096","citing_paper":"/paper/2601.00090"},"observation_digest":"sha256:343beb5088d8cafee72afcbacbc59fb25c32e2f8945e2a50991dc45f2ee0d91f","observation_id":"f7cc7435-15c9-461a-aad3-117776b30975","resolution":{"observed_at":"2026-05-16T17:53:11.782964Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"cited_work":{"arxiv_id":"2501.18096","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18096","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llms can see and hear without any training","venue":null,"work_id":"647a1037-36ec-47f9-9a2a-ae5778211d92","year":2025},"citing_paper":{"arxiv_id":"2604.07427","last_updated":"2026-04-08T17:35:36Z","snapshot_observed_at":"2026-08-09T00:13:27.562029Z","submitted_at":"2026-04-08T17:35:36Z","title":"Personalizing Text-to-Image Generation to Individual Taste","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T18:07:31.236729Z"},"links":{"cited_paper":"/paper/2501.18096","citing_paper":"/paper/2604.07427"},"observation_digest":"sha256:7b1b8fc57b06d129482baca81dc3fe9a14713873db5653a5f0419b931fe173d7","observation_id":"03fd9dca-c859-42c1-bd48-dfcfb2d0f5bb","resolution":{"observed_at":"2026-05-11T05:26:02.475416Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.18096/citation-record","integrity":"/paper/2501.18096/integrity","json":"/paper/2501.18096/citation-record.json","paper":"/paper/2501.18096"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:07.963230Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:07.963230Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:045ebcaebb4ad3a9a567600fabd82a53c85111aab11cbef9a6db5974aae7d802","observation_id":"07461521-f5d5-4dbc-ba99-b9eca04c3b9d","resolution":{"observed_at":"2026-08-10T00:46:07.963230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-10T00:46:07.970023Z","title":"B., Chaplot, D., Chudnovsky, J., Garg, S., Gervet, T., Ghosh, S., H \\'e liou, A., Jacob, P., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:07.970023Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:9852f195b471154b19a50734a837847c0d52ce1f93ed92164de5e42b1f51dfb8","observation_id":"f40734fc-2f39-4238-b0e9-b4ac7c89a2c0","resolution":{"observed_at":"2026-08-10T00:46:07.970023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:09.264346Z","title":"SPICE : S emantic propositional image caption evaluation","venue":null,"work_id":"3f969ee5-8c1c-4aa9-9a3c-3be6f86cce37","year":2016},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:07.975582Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:4a4993532fdc694d27f2e97b21c3323dd033ca127aca58a2305bcd726d504b10","observation_id":"4f5ce520-c345-42cb-8b39-daedf969618c","resolution":{"observed_at":"2026-08-10T00:46:09.269755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:09.248428Z","title":"and Lavie, A","venue":null,"work_id":"9f1f90d1-b359-4a1e-9789-0fa31041c393","year":2005},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:07.980903Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:02e700bb17a7ea85a647c3b4fd80f980a32cc71d02ded3780be46c4dccaeafc3","observation_id":"259fe07d-7b7f-43c5-89ef-e5b091e28ad5","resolution":{"observed_at":"2026-08-10T00:46:09.253716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:09.231047Z","title":"Improving image generation with better captions","venue":null,"work_id":"a896490b-4b7b-4ae2-973a-7fcc3953906e","year":2023},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:07.986739Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:5a2a3104b964b16210d7fd1ac8407fe3e994378e9448ef04ba05cc1bb0f32863","observation_id":"f7f04a0f-559b-4c16-a6f7-d1f502c76582","resolution":{"observed_at":"2026-08-10T00:46:09.237162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:07.991979Z","title":"W., Fidler, S., and Kreis, K","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:07.991979Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:bf1a36ef436307e8f6cdf5a489bae1973b64704715f24f3776c95d1ed26beb56","observation_id":"cb5f418e-b65d-4717-9e60-9717e8746d21","resolution":{"observed_at":"2026-08-10T00:46:07.991979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15807","last_updated":"2023-09-27T17:30:19Z","snapshot_observed_at":"2026-08-02T11:54:13.342379Z","submitted_at":"2023-09-27T17:30:19Z","title":"Emu: Enhancing Image Generation Models Using Photogenic Needles in a Haystack","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15807","snapshot_observed_at":"2026-08-10T00:46:07.998074Z","title":"Emu: Enhancing image generation models using photogenic needles in a haystack","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:07.998074Z"},"links":{"cited_paper":"/paper/2309.15807","citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:db105bc3986edac80ce4cee46fd8599cb6e7e4701b5217c30d65031c8fe4a0d7","observation_id":"8d80eda5-09d1-4c14-a4db-130921020026","resolution":{"observed_at":"2026-08-10T00:46:07.998074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.004275Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.004275Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:f4aa7db78ab60c71db7abeba52a098a1ec0bc549c85296cd3631a300b5b172b1","observation_id":"67571005-a8df-4362-aab6-cacfa53cad31","resolution":{"observed_at":"2026-08-10T00:46:08.004275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:09.192315Z","title":"Clotho: An audio captioning dataset","venue":null,"work_id":"6104e2f5-182c-4962-b597-60ffa1292574","year":2020},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.008906Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:f331a5adc6a03ece9807a46387db0c5095d9b8cf371df1d95bdc24c3b03b4d05","observation_id":"9ec30906-4b7d-4993-9436-66a84a2a57e2","resolution":{"observed_at":"2026-08-10T00:46:09.197196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T00:46:08.017455Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.017455Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:86bb4667d9c92bc5eb41658bc25eb924c23780db20c24f8324c782224536b11b","observation_id":"8c0cfefa-d255-443d-87bb-1d43bbba6d22","resolution":{"observed_at":"2026-08-10T00:46:08.017455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:09.176499Z","title":"M., Jain, A., Schmidt, L., Toshev, A., and Shankar, V","venue":null,"work_id":"f16c1983-3118-43f2-8ce3-82a87fe340f2","year":2024},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.023267Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:8e09f28fb15b936aae644612d33f0ada45e4f01c63410d6e69acae42de5777d5","observation_id":"d19565a3-573a-4ece-93c4-787d72b96cfe","resolution":{"observed_at":"2026-08-10T00:46:09.181512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04341","last_updated":"2025-02-12T19:02:07Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:59:52Z","title":"Interpreting the Second-Order Effects of Neurons in CLIP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04341","snapshot_observed_at":"2026-08-10T00:46:08.028501Z","title":"A., and Steinhardt, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.028501Z"},"links":{"cited_paper":"/paper/2406.04341","citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:cc76981ebc76149a936503ee5e1f406d27f5ace339b24248d30e71819b35df13","observation_id":"8dda7dcb-7a38-4118-9091-8a4fc12923ac","resolution":{"observed_at":"2026-08-10T00:46:08.028501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.06576","last_updated":"2015-09-02T08:24:59Z","snapshot_observed_at":"2026-07-06T04:27:45.692332Z","submitted_at":"2015-08-26T17:14:42Z","title":"A Neural Algorithm of Artistic Style","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.06576","snapshot_observed_at":"2026-08-10T00:46:08.033691Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.033691Z"},"links":{"cited_paper":"/paper/1508.06576","citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:800f9d0dc7c06e4f31805ee5a96f549fd5022d48c9a4d2e7c029be1bc33863ad","observation_id":"24436c06-49ae-487f-bbbd-1af9ed9e7331","resolution":{"observed_at":"2026-08-10T00:46:08.033691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:09.161176Z","title":"On the content bias in fr \\'e chet video distance","venue":null,"work_id":"24d46641-854b-4bde-96b7-3aad456c0a33","year":2024},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.038837Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:c6e94a704643ba2d120b999d3f650e379ff5fbb05738317acbefd612c57b712c","observation_id":"ee6ca5fe-c59e-4946-ab2d-0d88b34aa8a9","resolution":{"observed_at":"2026-08-10T00:46:09.165970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:09.144289Z","title":"F., Ellis, D","venue":null,"work_id":"9f1bcadb-6abc-41f7-aa5f-36c66aabe534","year":2017},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.043404Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:b839203598756ee6203b22bc6d0c407fa5454d5468c983da2237fc20b12868c9","observation_id":"54066178-ac0e-4576-b742-67253af18245","resolution":{"observed_at":"2026-08-10T00:46:09.150324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:09.127264Z","title":"V., Joulin, A., and Misra, I","venue":null,"work_id":"435acf7f-8256-487f-9065-ea0543a1d1a4","year":2023},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.047758Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:8c1035b2a4488d7d2037e4b562a4e6bad41caede25d3f8f27ceda2d17da12fe6","observation_id":"bfefb861-2462-44e1-91b4-ca65e854ed40","resolution":{"observed_at":"2026-08-10T00:46:09.132059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.052450Z","title":"S., Shah, A., Yin, X., Parikh, D., and Misra, I","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.052450Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:f9625182f7451aa26bce3503cbc3d0131cbaef4a635111d14355ffcce2475c7f","observation_id":"da8027aa-beb1-4bf2-a24d-36f98151b87b","resolution":{"observed_at":"2026-08-10T00:46:08.052450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:09.101248Z","title":"Mmg-ego4d: Multimodal generalization in egocentric action recognition","venue":null,"work_id":"49d24ed0-3340-493b-a9b2-1506c123ca7f","year":2023},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.057400Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:4a1046ee46b118ffe99168305444b3b9f5b4d34d2a586cb0f07ff539f7e029f8","observation_id":"fdd064a1-cf92-4143-9fd5-2bf110ec5155","resolution":{"observed_at":"2026-08-10T00:46:09.106134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:09.085269Z","title":"Audioclip: Extending clip to image, text and audio","venue":null,"work_id":"1c1d088e-da84-478c-b092-6bdb964c4d00","year":2022},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.062041Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:3f39a98b898b8a93ba08349939ee8eb770e6e86e32854a04624d4813eb0d0d36","observation_id":"2aa4606c-ac40-4d58-b040-be7ec5246a39","resolution":{"observed_at":"2026-08-10T00:46:09.091082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-10T00:46:08.066514Z","title":"P., Poole, B., Norouzi, M., Fleet, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.066514Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:d63a391e640a58011b73ad296598d9251c83557fa2ea71341fa589cde8f9ec06","observation_id":"0741e06d-d761-4090-95da-3600bbee57e9","resolution":{"observed_at":"2026-08-10T00:46:08.066514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:09.070423Z","title":"Openclip, 2021","venue":null,"work_id":"281d8d2d-680c-43c5-b56b-c47d7327826d","year":2021},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.071638Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:2ebadef626ee3361b1b089b11cb1f79d5f76ab746762f84987aad7ec235bad9b","observation_id":"20abe8e5-1b44-4608-a80a-2f1ca44b0f92","resolution":{"observed_at":"2026-08-10T00:46:09.074929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:09.054467Z","title":"Rethinking fid: Towards a better evaluation metric for image generation","venue":null,"work_id":"1f7b5043-34a2-4229-af87-369c19e70ef5","year":2024},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.076412Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:c54bba33f38fcb9a52120176bdf8b76104e13442068c95bf1d5c7fcc2e952810","observation_id":"50a54a14-ec58-44f2-b3be-4933370cbdc2","resolution":{"observed_at":"2026-08-10T00:46:09.059583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-10T00:46:08.081016Z","title":"Mistral 7b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.081016Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:f67d4a41e17c37627ef8be1f5cf437c8937ed0ed4a33df1f85ed681f53e45a59","observation_id":"e327ff0a-71c0-455a-8b32-53de2061b349","resolution":{"observed_at":"2026-08-10T00:46:08.081016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:09.040126Z","title":"and Fei-Fei, L","venue":null,"work_id":"438fed9c-3eea-4721-8c3b-05441cd5763e","year":2015},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.085982Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:18aca33cd255b9aca328947ed1087ef1b5dd5af52a4595d2cd5808141614d931","observation_id":"9e04e41e-d73b-49e9-a3d0-baeb2bf2f162","resolution":{"observed_at":"2026-08-10T00:46:09.044785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02580","last_updated":"2024-03-05T01:32:29Z","snapshot_observed_at":"2026-07-06T17:39:37.064843Z","submitted_at":"2024-03-05T01:32:29Z","title":"What do we learn from inverting CLIP models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02580","snapshot_observed_at":"2026-08-10T00:46:08.090384Z","title":"What do we learn from inverting clip models? arXiv preprint arXiv:2403.02580, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.090384Z"},"links":{"cited_paper":"/paper/2403.02580","citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:3556229683cf19ad2dcce4bdc51170b6588a43b0c97f17e4ec5aba6ebf799162","observation_id":"45df32dc-b331-40fc-8f74-81b7e508733e","resolution":{"observed_at":"2026-08-10T00:46:08.090384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:09.023250Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation","venue":null,"work_id":"fd73bb97-f378-4678-8788-c3e3cbed3dc8","year":2023},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.095404Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:f987c087c5b919e77911447c45099540c9ece9ee11a499ae120438174b386dfc","observation_id":"45345009-5da6-443e-8f01-318e7bb14201","resolution":{"observed_at":"2026-08-10T00:46:09.028909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:09.007259Z","title":"S., Reid, M., Matsuo, Y., and Iwasawa, Y","venue":null,"work_id":"041f88ad-440e-4f4c-a162-d28ade290cef","year":2022},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.100070Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:8ad43d8a9e3e4527c25fc4faa7b5953e6f7fcd9eb8ddb0d628bb3b47a26e6b24","observation_id":"50f1f474-5d21-4fa5-9df9-987b465c0df9","resolution":{"observed_at":"2026-08-10T00:46:09.012021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.992008Z","title":"Audio flamingo: A novel audio language model with few-shot learning and dialogue abilities","venue":null,"work_id":"560ac148-89db-4a0e-aabb-8298f7bb9b9c","year":2024},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.105072Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:2603161f05655eb998b8aa7b06c3444d5dc3041b46070d3a2f0d636faa27bc02","observation_id":"688e3352-7798-4a11-b2f5-d99be38bd7b3","resolution":{"observed_at":"2026-08-10T00:46:08.997000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.972352Z","title":null,"venue":null,"work_id":"279082dc-8560-4add-89c8-ab43073a43c0","year":2024},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.109523Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:24445724b4434b030f3c59df2cd9c16567b0a8a912f4f7c3a15455aa38d60d37","observation_id":"36a6ddfb-a057-4d2b-b35b-cbcf5ab1102b","resolution":{"observed_at":"2026-08-10T00:46:08.977632Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.956214Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"13cf32fa-3973-42c4-a361-56c551e8e0fe","year":2023},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.114123Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:47a67c5b15fb46d63d7499b48d2f3d0e7531e6df8622fc4803ed75daa83095b7","observation_id":"52c1ea4a-947f-4dd1-ad4c-5160baaccb34","resolution":{"observed_at":"2026-08-10T00:46:08.961288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-08-10T00:46:08.118465Z","title":"A large-scale dataset towards multi-modal multilingual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.118465Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:e597cd246780e81eff5dad03f6d6007f47e1442e355ccb4f913bc1e1d846193e","observation_id":"ac1e12be-fce0-4996-a55a-dcd92156cbe6","resolution":{"observed_at":"2026-08-10T00:46:08.118465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.940584Z","title":"DeCap : D ecoding CLIP latents for zero-shot captioning via text-only training","venue":null,"work_id":"ff5b6787-4df4-4ab7-b24a-c311c9b31854","year":2023},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.123749Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:3f1ef2774f62526b24d45c7fb0ef94e0900eef3dd4f4e809eaf2e3116694087d","observation_id":"aaddedd7-5f35-4e5b-9764-503fad42fcb9","resolution":{"observed_at":"2026-08-10T00:46:08.945732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.128461Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.128461Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:1287991058ac5c3ff024d5429b167e458497e1d77b18ab0e33028c3f6b4b717c","observation_id":"14a4ec48-b4ce-41cd-b469-16522d447a2b","resolution":{"observed_at":"2026-08-10T00:46:08.128461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-10T00:46:08.133554Z","title":"T., Ben-Hamu, H., Nickel, M., and Le, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.133554Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:50c85d441dc938e815cdcd9aa29160ef1367fb592e805f5eb40bc2dedc82f5bc","observation_id":"2cbe38f1-f7c2-43ad-ad6f-6b85627af581","resolution":{"observed_at":"2026-08-10T00:46:08.133554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17804","last_updated":"2024-03-26T15:42:01Z","snapshot_observed_at":"2026-08-09T09:51:38.554652Z","submitted_at":"2024-03-26T15:42:01Z","title":"Improving Text-to-Image Consistency via Automatic Prompt Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17804","snapshot_observed_at":"2026-08-10T00:46:08.138982Z","title":"Improving text-to-image consistency via automatic prompt optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.138982Z"},"links":{"cited_paper":"/paper/2403.17804","citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:9f8c15c54bd4a66e7b929cd4544cce5660754f77e2de5cefea7ed8277767c805","observation_id":"34264a0c-d475-4189-b526-fced26b8aac1","resolution":{"observed_at":"2026-08-10T00:46:08.138982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14562","last_updated":"2024-06-20T17:59:45Z","snapshot_observed_at":"2026-07-06T18:34:24.078145Z","submitted_at":"2024-06-20T17:59:45Z","title":"Whiteboard-of-Thought: Thinking Step-by-Step Across Modalities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14562","snapshot_observed_at":"2026-08-10T00:46:08.143919Z","title":"Whiteboard-of-thought: Thinking step-by-step across modalities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.143919Z"},"links":{"cited_paper":"/paper/2406.14562","citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:bb4bb39dd5e0f05fa44b3f4823ef531fb92f65bc7c021317706e96747b695ae0","observation_id":"593a6f57-3e95-44bb-a976-34d8cea1126d","resolution":{"observed_at":"2026-08-10T00:46:08.143919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.912708Z","title":"How T o100 M : L earning a T ext- V ideo E mbedding by W atching H undred M illion N arrated V ideo C lips","venue":null,"work_id":"92a69aac-edd0-43b3-974d-668530aac4ba","year":2019},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.148791Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:0a336adb047a6d1d178a1f320816e93d63d2c266b1137197f99d6fe5710f2518","observation_id":"1033a21d-83e2-4edf-aeba-44da51e4bdd5","resolution":{"observed_at":"2026-08-10T00:46:08.917534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07143","last_updated":"2024-08-09T22:37:25Z","snapshot_observed_at":"2026-08-02T14:27:24.212588Z","submitted_at":"2024-04-10T16:18:42Z","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07143","snapshot_observed_at":"2026-08-10T00:46:08.153195Z","title":"Leave no context behind: Efficient infinite context transformers with infini-attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.153195Z"},"links":{"cited_paper":"/paper/2404.07143","citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:db5588469057d187348010485163e735e5d4b6f829324ee083cfdce9c3a87e96","observation_id":"aa943601-8824-46bc-8f50-368d8e29c6bf","resolution":{"observed_at":"2026-08-10T00:46:08.153195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.896837Z","title":"H., Seybold, B., Hauth, A., Manen, S., Sun, C., and Schmid, C","venue":null,"work_id":"d9f9eafb-4ac3-4511-87e1-69073138a4a3","year":2022},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.158096Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:1d855c377dec47fca21e6a9c5cc35cfd2381c706a8339cc9381e002d31ec10b6","observation_id":"396a3532-bf3b-4daf-a936-b2a2bd6c225c","resolution":{"observed_at":"2026-08-10T00:46:08.902188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.879631Z","title":null,"venue":null,"work_id":"4830d28a-45f3-4980-89f0-1e166b59cb2d","year":2021},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.162744Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:331d3bd73a6b77ea3ed31b881af1880a3603ab0ff2ea38cb7e8eb9ff45becd8d","observation_id":"5dddf899-95dd-414b-b6d0-038afb215443","resolution":{"observed_at":"2026-08-10T00:46:08.885727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.861990Z","title":"Introducing openai o1-preview","venue":null,"work_id":"72d449f0-b5ba-4afd-8052-d5243dab061c","year":2024},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.167420Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:43c8acf60d583c7626bd91ddb3f5459b5f039636bf8447fc0777e93c0d45de50","observation_id":"10d47875-b6e7-4f60-83ca-41e7e4e945bf","resolution":{"observed_at":"2026-08-10T00:46:08.867355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.844118Z","title":"BLEU : A method for automatic evaluation of machine translation","venue":null,"work_id":"067ef929-82b8-4ec6-a44e-5955f8989a31","year":2002},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.172819Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:4d744ee2bf8a7c862edec5fd52116a45929fd75b9cb8b1025ba453bec85bdf25","observation_id":"b7918d94-7097-4632-a4d4-a19cd2c21e94","resolution":{"observed_at":"2026-08-10T00:46:08.849424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-10T00:46:08.177469Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.177469Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:4e4ec8442274fd075005449002c6cf80e943109bda31e952b447797f16621c4c","observation_id":"c4876983-387a-4576-a046-bea434a1ba8d","resolution":{"observed_at":"2026-08-10T00:46:08.177469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.182174Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., Krueger, G., and Sutskever, I","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.182174Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:e3bc167b735538da835294cab79f01138a7af77c0717a7769d24171b6004068a","observation_id":"d52ba24e-5c4a-4635-ac20-4c094d5ec01d","resolution":{"observed_at":"2026-08-10T00:46:08.182174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-10T00:46:08.186659Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.186659Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:b8f8bda841688bfae5896db85eb1e938d191ba7e8fa3057ff209cfcdc92d7bea","observation_id":"9baacafb-a287-4ef2-b54d-1cbb561e5bed","resolution":{"observed_at":"2026-08-10T00:46:08.186659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.191571Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.191571Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:1a6bcee1962ee877be956f283c66916c312a55f465893d45de749d825218fbfb","observation_id":"aa7d852a-d09a-49d4-bb44-801c457c92ca","resolution":{"observed_at":"2026-08-10T00:46:08.191571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.807081Z","title":"L., Ghasemipour, K., Gontijo Lopes, R., Karagol Ayan, B., Salimans, T., Ho, J., Fleet, D","venue":null,"work_id":"1404c19a-4811-4c68-91a1-4e1dcf87ac51","year":2022},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.196060Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:f2e30c4d8c6d3a95319e6606e987fc3776ac7e062ec709618bf2002baba6a186","observation_id":"0874f5f2-fb01-4a21-af90-4158959c883e","resolution":{"observed_at":"2026-08-10T00:46:08.812005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.791405Z","title":"Zero-shot audio captioning with audio-language model guidance and audio context keywords","venue":null,"work_id":"35a04d63-8957-4f06-8134-405c72f55f5d","year":2023},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.201000Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:c5c5f0d5c5d6f1794b0103a5c7397c6371df7786ae78a99b69afe34647934de3","observation_id":"7728eb58-c5f2-4394-9cd9-8e7d72f1312f","resolution":{"observed_at":"2026-08-10T00:46:08.796723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03884","last_updated":"2023-09-07T17:45:58Z","snapshot_observed_at":"2026-07-06T16:15:50.904062Z","submitted_at":"2023-09-07T17:45:58Z","title":"Zero-Shot Audio Captioning via Audibility Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03884","snapshot_observed_at":"2026-08-10T00:46:08.205600Z","title":"Zero-shot audio captioning via audibility guidance","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.205600Z"},"links":{"cited_paper":"/paper/2309.03884","citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:3e346d7aa4a0217fd8487154f573e4b754a460704f3cb25f50ea7f20867b3ba1","observation_id":"566a6112-59e8-49d9-b567-3629ee02ecd8","resolution":{"observed_at":"2026-08-10T00:46:08.205600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.775274Z","title":"H., Tan, H., Bansal, M., Rohrbach, A., Chang, K.-W., Yao, Z., and Keutzer, K","venue":null,"work_id":"be7d6dfc-1219-4938-81a8-97fb93ced5ce","year":2022},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.210966Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:ddcd65fe683347711955b7417d86741eca2e3754cdba4f3d48a30fe2ae29902d","observation_id":"da075a6e-f406-4cee-b340-a85ccdcbdc6c","resolution":{"observed_at":"2026-08-10T00:46:08.780741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.759484Z","title":"Emu edit: Precise image editing via recognition and generation tasks","venue":null,"work_id":"52e7732f-9ac1-406e-b0fb-7876e6ad9dac","year":2024},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.215648Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:a3aa0d6123318a667570622fc7c7043e9267a04d6e8354f8b4a85bf717cc818b","observation_id":"266e9844-c78d-4d8b-9996-41f9ca698977","resolution":{"observed_at":"2026-08-10T00:46:08.764846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.220243Z","title":"and Zisserman, A","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.220243Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:adac5c8334802ab84f32f6fc5caf8fa0b7859f2a1fa1f46dccd396df6979be9a","observation_id":"93a29c0a-a145-4515-bed3-dfa693881bb7","resolution":{"observed_at":"2026-08-10T00:46:08.220243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-10T00:46:08.224799Z","title":"S., Love, J., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.224799Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:8f588748db4ef5a41a0fa8e7598b00c6d08c327098d236202f6053988af354c8","observation_id":"5f0924f5-8430-486a-9718-8c1f6a86e3d4","resolution":{"observed_at":"2026-08-10T00:46:08.224799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.734126Z","title":"Zerocap: Zero-shot image-to-text generation for visual-semantic arithmetic","venue":null,"work_id":"8b2becac-836e-43ff-8d53-1c64479190d7","year":2022},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.229609Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:148a19d20f1be9b8d13c7176963bcf9fd76e65883301c697b84279052393fd81","observation_id":"45254f0e-ab4f-49be-85de-a6f2c7572252","resolution":{"observed_at":"2026-08-10T00:46:08.738738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.719667Z","title":"CIDEr : C onsensus-based image description evaluation","venue":null,"work_id":"a1c1ac2f-ee10-4385-9b23-ecd5881e4a70","year":2015},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.235076Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:7b6a27a95914db03a63a785f88f560b21691e29bccd6d12c12c940793892f0ff","observation_id":"5138eade-5d48-4783-bde5-0238c7b8605c","resolution":{"observed_at":"2026-08-10T00:46:08.724624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.703673Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":"dc067578-f9c7-4a47-989b-2b44d6b15587","year":2023},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.239669Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:a311d7d6589c94689fb17f96e83cd601649236e67baf7b5c2be7b8f57066fe39","observation_id":"ba63aaaa-e306-448c-9b55-4807c0e9e945","resolution":{"observed_at":"2026-08-10T00:46:08.708850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.687766Z","title":"V., Zhou, D., et al","venue":null,"work_id":"4e307990-447a-45f1-a9bc-98d053bb6e70","year":2022},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.244253Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:8cddbd1eb578f95eb41d5de4e4bc3d0eb0cadb0ce266df1223dfbb1b7495c239","observation_id":"3c11ff3c-043c-47d7-b8b2-5a1e44f33196","resolution":{"observed_at":"2026-08-10T00:46:08.692953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.670764Z","title":"E., Huang, P.-Y., Howes, R., Sharma, V., Li, S.-W., Ghosh, G., Zettlemoyer, L., and Feichtenhofer, C","venue":null,"work_id":"b15b2b2f-5073-4cbc-9f3b-84c3949c6519","year":2024},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.249134Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:157b1f588671e8bfc7f2d05de2aea3705816010aa35721d943eeadbafa929101","observation_id":"44818b35-f4e7-42e0-bd36-ffc37988b3c4","resolution":{"observed_at":"2026-08-10T00:46:08.675933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.655391Z","title":"MSR-VTT : A large video description dataset for bridging video and language","venue":null,"work_id":"5f5f07d4-1b8b-491d-bfec-fc5ccf2c10fe","year":2016},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.253807Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:03a7357a970b1216f1b8d02440a13561412d5172df1610483d6bd3c38ac164ed","observation_id":"dc653a20-dfca-4130-9302-d9e9532d66bb","resolution":{"observed_at":"2026-08-10T00:46:08.660540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.640515Z","title":"V., Zhou, D., and Chen, X","venue":null,"work_id":"8de49d50-a20c-4083-a664-cb25854f46d9","year":2023},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.258318Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:912b45fc1c749713b49a374e4f0af41d651b228461190782bebd4fe60b13f984","observation_id":"69bb8738-4a48-403b-ab0e-cbe856820531","resolution":{"observed_at":"2026-08-10T00:46:08.645005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.625439Z","title":"ConZIC : Controllable zero-shot image captioning by sampling-based polishing","venue":null,"work_id":"be797845-361a-416e-90c1-634b8c34b641","year":2023},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.262763Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:0aa2636630902d6b5389b507ec930a81bc3d824cc1d5c36acbab4dd340b9de53","observation_id":"3c9f03ad-4cec-483f-ad2e-a15fc1827c61","resolution":{"observed_at":"2026-08-10T00:46:08.630321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.609226Z","title":"Meacap: Memory-augmented zero-shot image captioning","venue":null,"work_id":"9291986f-e809-41c0-a44d-c8acaa81e904","year":2024},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.267580Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:f3c8402d9521f6a6c10e99bbf2d91fccd47790b9c8525c4f8fd64bf35c5ddc59","observation_id":"4ed7780e-fb70-4000-b3f7-e11c6360ea04","resolution":{"observed_at":"2026-08-10T00:46:08.614899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.272230Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.272230Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:36c64b8a39a97e94e24a42af150a7a04079366cae698cff68042a9afdad6b1a7","observation_id":"fc8b6ceb-0b37-4262-907d-dc8bf1a118a5","resolution":{"observed_at":"2026-08-10T00:46:08.272230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:08.581598Z","title":"a henb \\","venue":null,"work_id":"7c059a21-a22f-4558-8c17-d067edba82e9","year":2022},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.276886Z"},"links":{"citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:3aedecb5bdcfa0ba7877a21d95c19f50ef3bcf7844aae24af752670ce846393d","observation_id":"88cde246-7d4e-4957-9ac3-b77d3112e4f5","resolution":{"observed_at":"2026-08-10T00:46:08.588755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":36},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 4 inbound Pith citation observations for arXiv:2501.18096."}