{"as_of":"2026-08-08T12:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:99a3334c76e200c878f87f33d4b44150777b00470f5550f4896af26a3496bd9b","coverage":[{"denominator":123,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T21:25:27.288300Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.09717/citation-record","integrity":"/paper/2509.09717/integrity","json":"/paper/2509.09717/citation-record.json","paper":"/paper/2509.09717"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.568746Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.568746Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:d681c263456f9a453a00fe14efe5bbb5c0038e830449bbc52bca1ec2de6f28f1","observation_id":"f2773827-75a3-47c3-820d-11bd236c39a0","resolution":{"observed_at":"2026-08-04T21:25:26.568746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.575691Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.575691Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:902f11e6f9852548a04c557951ad2b08e87000add581972424186d8d5a0c70d4","observation_id":"a3196e02-8a17-4eae-b2ca-7b4c4fccbee3","resolution":{"observed_at":"2026-08-04T21:25:26.575691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.582775Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.582775Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:b5707ddc0e67d7095978f9a0a7b931f380b91ac81cde654429a64c971f898610","observation_id":"a05e9955-7c72-4f18-a048-e542adba6200","resolution":{"observed_at":"2026-08-04T21:25:26.582775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.590262Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.590262Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:86039f0383ae2518565e50b16f362f9490aff7db28168464df8a5b93d8222fc4","observation_id":"3e732957-04b3-454e-a69a-2081c3d8a33a","resolution":{"observed_at":"2026-08-04T21:25:26.590262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.596268Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.596268Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:1b243423d62be86dd81afce7bc114513f8957e8b3de99bdecae607776534f4a3","observation_id":"73eda8d4-c2cc-4b6a-8a19-cbb7a2817182","resolution":{"observed_at":"2026-08-04T21:25:26.596268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-04T21:25:26.603213Z","title":"Denk, Zal´ an Borsos, Jesse Engel, Mauro Verzetti, Antoine Caillon, Qingqing Huang, Aren Jansen, Adam Roberts, Marco Tagliasacchi, Matt Sharifi, Neil Zeghidour, and Christian Frank","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.603213Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:6b58484e7cc247bfe86b8dcbbf2490b7ddb8ba1d38f3ac5afd0410a881580206","observation_id":"fdecdf9e-7d72-433a-a58f-cc59b3d5ccaa","resolution":{"observed_at":"2026-08-04T21:25:26.603213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.610281Z","title":"Don’t Just Assume; Look and Answer: Overcoming Priors for Visual Question Answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.610281Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:173bde04a123b255bf5243aad348b4ee85d01040754941cc8fc4cfb01f211a3c","observation_id":"30b1b9fa-3cbc-4db3-8af1-1fa9a452d78d","resolution":{"observed_at":"2026-08-04T21:25:26.610281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.616045Z","title":"Mistral Models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.616045Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:5c873a32c5c87c9279d7fb6f3dab0c998874b73128e25532b2f8e5d6bcfe57b5","observation_id":"9dc492ba-08cb-4972-9fc4-c7814d9eb3fa","resolution":{"observed_at":"2026-08-04T21:25:26.616045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.622613Z","title":"Transcripter- Generation of the transcript from audio to text using Deep Learning.International Journal of Computer Sciences and Engineering, 7(1):770–773, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.622613Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:c616741cd9e0fc2da16780df00f5091e59f03009eb9b829b4cbb13a2fd5fc018","observation_id":"a0aa1203-489f-4ccc-a811-9e9ff8a99709","resolution":{"observed_at":"2026-08-04T21:25:26.622613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.630294Z","title":"The Claude 3 Model Family: Opus, Sonnet, Haiku, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.630294Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:31b1db599737c62a3d672dca1bd4b8281898733443450683f067bc02f5149ea5","observation_id":"f6c6ed46-b1e8-4bda-80ed-e5bb48a66962","resolution":{"observed_at":"2026-08-04T21:25:26.630294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.635144Z","title":"Claude 3.7 Sonnet and Claude Code, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.635144Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:dc2a9e4ad257c3adae6549eaa0e96f53d0fc7801a6841a11dc092c60a0509609","observation_id":"264247d8-e039-464b-8b52-798c1768a358","resolution":{"observed_at":"2026-08-04T21:25:26.635144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.641339Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Auto- mated Generation Pipeline with Large Audio and Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.641339Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:b47dd70cd7ce2b9e36ee2c2c2dbf43b4053386492f05b2b696c97b51267ec2e5","observation_id":"af19f626-c13b-44ea-a39a-4bc7577bf874","resolution":{"observed_at":"2026-08-04T21:25:26.641339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.649251Z","title":"Are Mod- els Biased on Text without Gender-related Language? InProceedings of the 12th International Conference on Learning Representations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.649251Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:188d378e2e3dbad7022b97d6b39ee88c82992cbdc317408575940ccd27453f01","observation_id":"1b3e2439-fd12-4a7b-b049-34ec221eb8f9","resolution":{"observed_at":"2026-08-04T21:25:26.649251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.654893Z","title":"Ballester","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.654893Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:92ca0011a8a70be174c7cf8091a30ca44aab9425c938ade98e453479893059b2","observation_id":"c9e1f668-242a-4ffd-b03c-3a86f74b18cd","resolution":{"observed_at":"2026-08-04T21:25:26.654893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.661088Z","title":"Improving Image Generation with Better Captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.661088Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:4670df14754c00cb2f913bb3e7dfefc8dac294aebf6b2f39b7427624dc4e9b22","observation_id":"1fd800a7-ff39-4098-8915-37b54e294be5","resolution":{"observed_at":"2026-08-04T21:25:26.661088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00810","last_updated":"2023-09-02T03:27:20Z","snapshot_observed_at":"2026-08-04T08:54:36.402213Z","submitted_at":"2023-09-02T03:27:20Z","title":"RenAIssance: A Survey into AI Text-to-Image Generation in the Era of Large Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00810","snapshot_observed_at":"2026-08-04T21:25:26.666579Z","title":"Clifton, Yuxiong He, Dacheng Tao, and Shuaiwen Leon Song","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.666579Z"},"links":{"cited_paper":"/paper/2309.00810","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:2afdb09ec586056df5713d67e138cfcf730941d8c1cdc968b0564e20e55d466f","observation_id":"20547dc6-b008-4d2c-947b-a66803d7055c","resolution":{"observed_at":"2026-08-04T21:25:26.666579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.674010Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.674010Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:692dcceaf6b6743e9630dc2d8af7f2f304a9c53f8a994c6d9374d6340ae79041","observation_id":"fcc6e1ec-fb5d-4440-9ba7-70abb84a231e","resolution":{"observed_at":"2026-08-04T21:25:26.674010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.680984Z","title":"A contemporary review on chatbots, AI-powered virtual conversa- tional agents, ChatGPT: Applications, open challenges and future research directions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.680984Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:13f083bc4af382c1d012d7c399206b42bb290780947cd044db168e840d5afbe6","observation_id":"ab37063a-de8f-43b6-bfe1-d16d0dc28503","resolution":{"observed_at":"2026-08-04T21:25:26.680984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.690305Z","title":null,"venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.690305Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:09a7cc7cd463fe3c58bcc3880df912da17cf1718fa8e59096a3aa1a1066ff03f","observation_id":"82dcdb46-bde2-4d42-b8ce-53cdd125d978","resolution":{"observed_at":"2026-08-04T21:25:26.690305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.697479Z","title":"Veo, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.697479Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:4d1b3333fcb6fac9cbdf26c14120ab53186c444d54b6fbf37c4fed91db354376","observation_id":"bc3c8152-5272-4f11-a4e6-d8dcb2bad7cb","resolution":{"observed_at":"2026-08-04T21:25:26.697479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T21:25:26.706108Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Rein- forcement Learning.ArXiv, 2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.706108Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:6ae05ac8b8b46b04b97dbc0686237165a79cba6a7540bb4c96bb880b5bf814ab","observation_id":"309f9b93-2acc-4a5f-a337-cf7a05d6abc1","resolution":{"observed_at":"2026-08-04T21:25:26.706108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.712700Z","title":"A Survey of On-Device Machine Learning: An Algorithms and Learning Theory Perspective.ACM Transactions on Internet of Things, 2(3), 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.712700Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:193eddc449c6954e2eafd377693e2fc380e37109b5468215400227f9bcc2755b","observation_id":"8de0c676-9fd4-422e-ac60-8fa77d590a9b","resolution":{"observed_at":"2026-08-04T21:25:26.712700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00341","last_updated":"2020-04-30T09:02:45Z","snapshot_observed_at":"2026-08-06T03:57:57.420510Z","submitted_at":"2020-04-30T09:02:45Z","title":"Jukebox: A Generative Model for Music","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00341","snapshot_observed_at":"2026-08-04T21:25:26.718047Z","title":"Jukebox: A Generative Model for Music.ArXiv, 2005.00341, 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.718047Z"},"links":{"cited_paper":"/paper/2005.00341","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:599fea5d0beaae5324afc2693a96846a07f44a0695a116674f5158976fdbf71b","observation_id":"2ef99852-0c8f-45c3-a4b6-81286b25bc31","resolution":{"observed_at":"2026-08-04T21:25:26.718047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-04T21:25:26.723712Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.723712Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:95afcf8f82cd5486ed84d4c558ff29cf640461371ac58521417126c87c30c0b4","observation_id":"fc4d511e-d4f1-4943-bbe4-4729dfd730d9","resolution":{"observed_at":"2026-08-04T21:25:26.723712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.730575Z","title":"Grok, Gemini, ChatGPT and DeepSeek: Comparison and Applications in Conversational Artificial Intelligence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.730575Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:dcd50a05b273b6445cbdec3a49d430d17d6131a3a0cb34764cd6fa66d3e56dff","observation_id":"3da38730-450b-4774-b7e8-e809ea7f9be0","resolution":{"observed_at":"2026-08-04T21:25:26.730575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.738911Z","title":"Image Generation: A Review.Neural Processing Letters, 54(5):4609–4646, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.738911Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:b286223d971b3213327327284a66da62e8ce430a2d491f66e56f8195fbfdeb41","observation_id":"9f2c13e2-b696-45c9-82cd-af72e946ec29","resolution":{"observed_at":"2026-08-04T21:25:26.738911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-04T21:25:26.744606Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.744606Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:f9d1838996b9bda8cc8f0ec5578286f7594c11b44c814c0d69a064465cdddadc","observation_id":"fa9b58c6-6e37-4aa8-ba87-ba78c7eb8c3d","resolution":{"observed_at":"2026-08-04T21:25:26.744606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.750603Z","title":"Learning From Noisy Correspondence With Tri-Partition for Cross-Modal Matching.IEEE Transactions on Multimedia, 26:3884–3896, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.750603Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:3e758814a5bfa219c7913903226fd6877c2fdde2fccf443673c6fde7dfea2f9d","observation_id":"ee78b31a-84de-4bf3-bd58-33552e137ab4","resolution":{"observed_at":"2026-08-04T21:25:26.750603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14318","last_updated":"2025-02-20T07:13:29Z","snapshot_observed_at":"2026-08-07T18:02:47.541776Z","submitted_at":"2025-02-20T07:13:29Z","title":"Line Goes Up? Inherent Limitations of Benchmarks for Evaluating Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14318","snapshot_observed_at":"2026-08-04T21:25:26.758106Z","title":"Line Goes Up? Inherent Limitations of Benchmarks for Evaluating Large Language Models.ArXiv, 2502.14318, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.758106Z"},"links":{"cited_paper":"/paper/2502.14318","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:7fb6d064b25bc78410070d9d6eae3a5b94fc75427201052a3eeb6fae7304aaf3","observation_id":"047ae5d0-4bd9-4baf-8a9d-3790b8fe4c05","resolution":{"observed_at":"2026-08-04T21:25:26.758106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.02726","last_updated":"2025-02-13T12:12:28Z","snapshot_observed_at":"2026-08-02T22:12:00.951489Z","submitted_at":"2021-04-06T18:00:06Z","title":"Creativity and Machine Learning: A Survey","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.02726","snapshot_observed_at":"2026-08-04T21:25:26.764195Z","title":"Creativity and Machine Learning: A Survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.764195Z"},"links":{"cited_paper":"/paper/2104.02726","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:a21785d315492bc8d48b7739c193f659f71b40ef0a89a9b3593b087f48d7fd3d","observation_id":"ad942ac4-e177-4d3f-921c-3aa1448bd327","resolution":{"observed_at":"2026-08-04T21:25:26.764195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-04T21:25:26.772408Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling.ArXiv, 2101.00027, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.772408Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:12a27df9a2a9cf0cc3340bbef7c4f27be92c24f9d555e42ea2b5b8c0dce2dc46","observation_id":"bc1a4d8b-6bd8-46f1-9916-ab35fab94150","resolution":{"observed_at":"2026-08-04T21:25:26.772408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05665","last_updated":"2023-05-31T04:57:12Z","snapshot_observed_at":"2026-07-06T15:25:12.782361Z","submitted_at":"2023-05-09T17:59:07Z","title":"ImageBind: One Embedding Space To Bind Them All","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05665","snapshot_observed_at":"2026-08-04T21:25:26.782500Z","title":"ImageBind: One Embedding Space To Bind Them All.ArXiv, 2305.05665, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.782500Z"},"links":{"cited_paper":"/paper/2305.05665","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:00ce31d7be16cb9816558a6f3ef99cfe175d65c4572ee13474beb997565634e8","observation_id":"09e8c540-3a19-48e0-8d72-22511bc0c912","resolution":{"observed_at":"2026-08-04T21:25:26.782500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-04T21:25:26.792335Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces.ArXiv, 2312.00752, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.792335Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:bd8b34a8bdb3e91e6228a4f96115743eee738208558533658e21c4e10075ddda","observation_id":"119adbf1-bf88-4802-853f-34a2ac03bf28","resolution":{"observed_at":"2026-08-04T21:25:26.792335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13043","last_updated":"2021-06-24T14:16:38Z","snapshot_observed_at":"2026-08-04T12:48:20.635692Z","submitted_at":"2021-06-24T14:16:38Z","title":"AudioCLIP: Extending CLIP to Image, Text and Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.13043","snapshot_observed_at":"2026-08-04T21:25:26.798563Z","title":"AudioCLIP: Extend- ing CLIP to Image, Text and Audio.ArXiv, 2106.13043, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.798563Z"},"links":{"cited_paper":"/paper/2106.13043","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:08198499d07e58b850eef0fa7db1f6512954817671499af584bab119227b1207","observation_id":"406eddbf-0f26-4e61-a2d9-0a886814416a","resolution":{"observed_at":"2026-08-04T21:25:26.798563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.806461Z","title":"Deep Residual Learning for Image Recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.806461Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:595e5acb46d56784b05efc0f7ebbfb9bf5b100707b50997ef1a1b701f7c1078c","observation_id":"ffbee515-f413-429f-9cdd-85b23af3b599","resolution":{"observed_at":"2026-08-04T21:25:26.806461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.812512Z","title":"Ringle, and Rudolf R","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.812512Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:f1bac656895f7aa3200130ec56266ba0ea181b03f43331bffa2197b4a3eccbad","observation_id":"d0ee86c4-a0bb-4610-862c-89a99d38fcfb","resolution":{"observed_at":"2026-08-04T21:25:26.812512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.818748Z","title":"Intuitive Multilingual Audio-Visual Speech Recognition with a Single-Trained Model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.818748Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:ce90ff8ceaa252cd7e6ce43828c06650c3e609609e37abd1abdba146fbeebfd6","observation_id":"4d61857a-ddd6-4619-a87e-a0626dc1af99","resolution":{"observed_at":"2026-08-04T21:25:26.818748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.825041Z","title":"Make-an-audio: text-to-audio generation with prompt-enhanced diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.825041Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:a8e34cc887b001a63f221912386b2c2fb5775cb279eabad0154457ee2c56efae","observation_id":"cc085099-2c40-44a1-8e42-403256fd10a6","resolution":{"observed_at":"2026-08-04T21:25:26.825041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.832038Z","title":"NLIP: Noise-Robust Language-Image Pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.832038Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:5d53f6d04f7e0893b78cfbac4f1b94ef20c956d6a61567565cc6271c65d677a5","observation_id":"df0d6c3f-633e-4981-8fb9-65f2ecdd678f","resolution":{"observed_at":"2026-08-04T21:25:26.832038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01245","last_updated":"2025-04-02T17:29:11Z","snapshot_observed_at":"2026-08-07T17:34:38.379767Z","submitted_at":"2025-03-03T07:17:30Z","title":"Large Language Models for Code Generation: A Comprehensive Survey of Challenges, Techniques, Evaluation, and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01245","snapshot_observed_at":"2026-08-04T21:25:26.837379Z","title":"Large Language Models for Code Generation: A Com- prehensive Survey of Challenges, Techniques, Evaluation, and Applications.ArXiv, 2503.01245, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.837379Z"},"links":{"cited_paper":"/paper/2503.01245","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:5e38a2c639db724ce97dbfaf88871a463d482708fe4580c796967702269a5587","observation_id":"98e98fc0-7756-49d1-a249-36c0ef3a0af8","resolution":{"observed_at":"2026-08-04T21:25:26.837379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.844739Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.844739Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:04534193185246e9391a1c67f181fc16f3874abdc490972e5cc4e7d9c83372ce","observation_id":"46dae24a-4596-4be1-a69b-016b472057f1","resolution":{"observed_at":"2026-08-04T21:25:26.844739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00515","last_updated":"2024-11-10T22:02:27Z","snapshot_observed_at":"2026-07-29T20:40:25.374189Z","submitted_at":"2024-06-01T17:48:15Z","title":"A Survey on Large Language Models for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00515","snapshot_observed_at":"2026-08-04T21:25:26.851346Z","title":"A Survey on Large Language Models for Code Generation.ArXiv, 2406.00515, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.851346Z"},"links":{"cited_paper":"/paper/2406.00515","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:aa3c2cb0c393afa1120958f413d641a454ae45e08ee4cc8e1d1f203732f062c5","observation_id":"0a4d095f-b77c-4ee5-a5aa-9c072ebfc696","resolution":{"observed_at":"2026-08-04T21:25:26.851346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11225","last_updated":"2022-11-21T07:40:01Z","snapshot_observed_at":"2026-08-05T21:35:06.193836Z","submitted_at":"2022-11-21T07:40:01Z","title":"TimbreCLIP: Connecting Timbre to Text and Images","version":1},"cited_work":{"arxiv_id":"2211.11225","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.11225","snapshot_observed_at":"2026-08-04T21:25:28.334295Z","title":"TimbreCLIP: Connecting Timbre to Text and Images","venue":"cs.SD","work_id":"78c19035-64b7-48a0-927a-64b20e37dcd8","year":2022},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.858805Z"},"links":{"cited_paper":"/paper/2211.11225","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:00339c46bab88df7acaac2fd1d4633bb8ee18e00d60fd041141146ef268af448","observation_id":"e2250698-490c-43ca-9507-c52ddad3006b","resolution":{"observed_at":"2026-08-04T21:25:28.343551Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.864893Z","title":"Noise-Aware Learning from Web-Crawled Image-Text Data for Image Captioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.864893Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:3b86b0843e66e6dc3a942ac74c4888f67c1b5544568ddd5f67132c19c130fe48","observation_id":"6c058880-0ef4-4c78-af9a-c283e4103de4","resolution":{"observed_at":"2026-08-04T21:25:26.864893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.871127Z","title":"Gemini 2.5: Our most intelligent AI model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.871127Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:3e2aa3237abbaad3196af49c9c224d8fe00c7f99b10e81239942e7485a478dd9","observation_id":"69b1f822-cf4d-45df-ac9c-c41495f623ae","resolution":{"observed_at":"2026-08-04T21:25:26.871127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.877668Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.877668Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:478cf93d54f65e7d7f7d00bea25ce0f805124dbee52c2bf53becae28f2b02316","observation_id":"4d7c3d45-3127-4197-aa5a-f7c0b94c6f3a","resolution":{"observed_at":"2026-08-04T21:25:26.877668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.887383Z","title":"Kingma and Max Welling","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.887383Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:92ac4b8cea0f83dbea39f8e49bef4af831158fbd35dc7ab22ec7b842cf1ecd6b","observation_id":"d253f024-d21b-4968-b2e5-759b970f9219","resolution":{"observed_at":"2026-08-04T21:25:26.887383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-08-04T21:25:26.892235Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators.ArXiv, 2309.17012, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.892235Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:8623565f7ca3401eaefd38b2b9fe7fbbc1d0870df8c2adeffd28f086c838d216","observation_id":"e4a5ec78-d9dc-4d66-ba76-3f0446d240da","resolution":{"observed_at":"2026-08-04T21:25:26.892235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.898143Z","title":"Do Large Language Models Pay Similar Attention Like Human Programmers When Generating Code?Proceedings of the ACM on Software Engineering, 1(FSE):2261–2284, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.898143Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:27ad39eaf9ac5d951c154f3089fbda80903e31950308d9316edbdae198889215","observation_id":"5d376a71-001d-4b19-8ad8-e663da3d7499","resolution":{"observed_at":"2026-08-04T21:25:26.898143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-07T16:54:38.689558Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-04T21:25:26.909866Z","title":"AudioGen: Textually Guided Audio Generation.ArXiv, 2209.15352, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.909866Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:3e0a8c99db08bba335d96c5d123f243ca302cc5f463c1f638a019fb2c39d9c2d","observation_id":"b2ed3cc5-127e-42e8-a0e2-220132449bde","resolution":{"observed_at":"2026-08-04T21:25:26.909866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.916774Z","title":"BindDiffusion: One Diffusion Model to Bind Them All, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.916774Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:a6a52c6267d6513d5a5b5228bc7473382566028da809ca6dc91c472a8dea50ac","observation_id":"435325f9-0ec9-4167-a8c6-b8d4486fe4ad","resolution":{"observed_at":"2026-08-04T21:25:26.916774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.923550Z","title":"FLUX, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.923550Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:76472bb6a63ef70437678c814dbd0a16f59aaec8f973d588e6b73add9de34e17","observation_id":"976fec45-ace3-47a1-b262-0ec5f103148f","resolution":{"observed_at":"2026-08-04T21:25:26.923550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"cited_work":{"arxiv_id":"2509.05786","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.05786","snapshot_observed_at":"2026-08-04T21:25:28.232250Z","title":"Effectively obtaining acoustic, visual and textual data from videos","venue":"cs.MM","work_id":"a7b538d6-9014-487e-acad-ecee85090ce9","year":2025},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.928879Z"},"links":{"cited_paper":"/paper/2509.05786","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:ad80beda56b6a4a7c9b6d0f6c5f286765048b8e4a3ad7f9229ebf88050bed732","observation_id":"7f772987-5f54-46cf-9866-ec6efe4b5788","resolution":{"observed_at":"2026-08-04T21:25:28.242608Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-04T21:25:26.940451Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Mod- els.ArXiv, 2301.12597, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.940451Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:81fa4c19e03eaf1022a5426b3ff815ce02c51795f841d75a0b1068872164626f","observation_id":"e5a97f0b-c847-4cce-9647-fee7cfe9f742","resolution":{"observed_at":"2026-08-04T21:25:26.940451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-02T08:01:43.194717Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-04T21:25:26.951332Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Gen- eration.ArXiv, 2201.12086, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.951332Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:cbcb3f92018258a063cb7b66888bb5f3b241336dd4059a5a0931504b67eef3b4","observation_id":"41c23dbc-f4c8-4775-a078-abb7d87613f1","resolution":{"observed_at":"2026-08-04T21:25:26.951332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05500","last_updated":"2023-06-03T21:39:07Z","snapshot_observed_at":"2026-07-06T15:40:27.639368Z","submitted_at":"2023-06-03T21:39:07Z","title":"Word-Level Explanations for Analyzing Bias in Text-to-Image Models","version":1},"cited_work":{"arxiv_id":"2306.05500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.05500","snapshot_observed_at":"2026-08-04T21:25:28.137278Z","title":"Word-Level Explanations for Analyzing Bias in Text-to-Image Models","venue":"cs.CL","work_id":"e99b6ebf-f2d9-4352-aa9f-dca0e5949c11","year":2023},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.959197Z"},"links":{"cited_paper":"/paper/2306.05500","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:d416bad67c9834ce7da7f86f9fa1ca94b722ae33c5303decc0f802c5c3d49706","observation_id":"d24a96c5-b7d6-4c71-ab90-f8bde6247612","resolution":{"observed_at":"2026-08-04T21:25:28.146878Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.966726Z","title":"Plumbley","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.966726Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:1202bc13ec1bf0c096479679eed1bca1e5af9a6e6b1a15f09eefa4857482097c","observation_id":"1294e260-46d8-432a-bb08-7ca16290258f","resolution":{"observed_at":"2026-08-04T21:25:26.966726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-04T21:25:26.973235Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models.ArXiv, 2402.17177, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.973235Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:a811171edf66d46509b9dd3aa974263a2fbb5ea3fa22b203ab4b75597ab0d330","observation_id":"21019a34-676b-45d6-8db4-d5e6457671e8","resolution":{"observed_at":"2026-08-04T21:25:26.973235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.980025Z","title":"Michaud, Max Tegmark, and Mike Williams","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.980025Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:7c34b90240b1a045f733ca96b882397026ec530e3f992a58dd71609b30fddddf","observation_id":"34c387b4-362c-40dd-be69-e07d440041c2","resolution":{"observed_at":"2026-08-04T21:25:26.980025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:26.985740Z","title":"BLAP: Bootstrapping Language-Audio Pre-training for Music Captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.985740Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:c855eec3d63eb8c869b3b181bbc6b48ce841b3db913a6f7df617ebb87ac23a01","observation_id":"9724b24e-3ecf-4c90-bd92-f7a47ee7a40e","resolution":{"observed_at":"2026-08-04T21:25:26.985740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12020","last_updated":"2025-03-05T08:09:07Z","snapshot_observed_at":"2026-07-06T18:02:02.384288Z","submitted_at":"2024-04-18T09:16:02Z","title":"Look, Listen, and Answer: Overcoming Biases for Audio-Visual Question Answering","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12020","snapshot_observed_at":"2026-08-04T21:25:26.993264Z","title":"Look, Listen, and Answer: Overcoming Biases for Audio-Visual Question Answering.ArXiv, 2404.12020, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.993264Z"},"links":{"cited_paper":"/paper/2404.12020","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:79e183d6d859307b841b6a3e3ddf92f6a7a3cb6ac08f470d10d30916398f73bb","observation_id":"2da851cd-2682-42f5-88a5-89d4d333f690","resolution":{"observed_at":"2026-08-04T21:25:26.993264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:27.003073Z","title":"Stable Diffusion Akashic Records, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.003073Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:841d2517589ac937e8e410999de71b32f05fd03937c75eb19e81c4cacb6881f1","observation_id":"8d17c90f-f472-4576-a9dc-85ca822f9bd4","resolution":{"observed_at":"2026-08-04T21:25:27.003073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:27.008405Z","title":"Inadequacies of Large Language Model Benchmarks in the Era of Generative Artificial Intelligence.IEEE Transactions on Artificial Intelli- gence, pages 1–18, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.008405Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:68b4b4604b100e517707b59b7cf3f1b12ea1bde7720ba95deb10f2db3d7687ab","observation_id":"3a15c995-acde-409f-ae15-874ae5110b08","resolution":{"observed_at":"2026-08-04T21:25:27.008405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:27.015737Z","title":"Mustango: Toward Controllable Text-to-Music Generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.015737Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:cf7dde4ea50d8c807ce3c3b1d977a4c645899e11c26ec6ee839b02197ef45796","observation_id":"9df21f03-dd77-4c91-b5d1-001243792a5a","resolution":{"observed_at":"2026-08-04T21:25:27.015737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:27.028569Z","title":"Mukhamediev, Adilkhan Symagulov, Yan Kuchin, Kirill Yakunin, and Ma- rina Yelis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.028569Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:ee0c659f91e3469338cc223579887daaab4eeb25bdb8a0b72470006dd915c393","observation_id":"4ff0f8b1-b540-4fad-a911-2893145cd957","resolution":{"observed_at":"2026-08-04T21:25:27.028569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:27.040043Z","title":"DALL·E 3 System Card, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.040043Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:03331ffb00372936eeca0981c6c438c08061f6cc916c0f3d8d70f40025ec1379","observation_id":"1e474672-964f-487d-9555-73187522931d","resolution":{"observed_at":"2026-08-04T21:25:27.040043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:27.046611Z","title":"Video generation models as world simulators, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.046611Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:72e770e0f543b1cde8096afaa2a7300cb91104e665d5088f75165da96fef6aa5","observation_id":"68eebaa9-7df4-4b8f-932d-d2b1201983c5","resolution":{"observed_at":"2026-08-04T21:25:27.046611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:30.046492Z","title":"OpenAI o3-mini, 2025","venue":null,"work_id":"1833f55c-4262-4c39-a57c-1ec13a830162","year":2025},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.055357Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:5cace00cb9ea12cbf897654760357760c7503f17427064b91d92d3f8f90afd24","observation_id":"d34ea8b4-de07-4fa4-9651-94139d0d5480","resolution":{"observed_at":"2026-08-04T21:25:30.124640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:29.878286Z","title":"Image-to-Image Translation: Methods and Applications.IEEE Transactions on Multimedia, 24:3859–3881, 2022","venue":null,"work_id":"21e3b416-16e1-4244-ba9a-c598158fa956","year":2022},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.064624Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:c46b50f8e70c57cf1f03280844ecc8fa20954b9f7a4a6ee065edaeba85307076","observation_id":"fc5b0e53-a0ec-41a7-bd91-a40affe9a61e","resolution":{"observed_at":"2026-08-04T21:25:29.944903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-04T21:25:27.072098Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis.ArXiv, 2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.072098Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:8da72f95de2a7f70e82dbb9a4fa53e19cc4941e48ddb0f31f7051c6a1a800fa2","observation_id":"d2ad6525-3af7-4fbf-bffa-451c752a362e","resolution":{"observed_at":"2026-08-04T21:25:27.072098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:29.748029Z","title":"Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets","venue":null,"work_id":"cfaab46e-131b-4036-bf56-220e0dc86529","year":2021},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.079736Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:44d5a5a4944319feb1e6254d9ab787513a68d9d1dd5fd478fd28fa38cbd095b4","observation_id":"9873f815-964c-4990-a342-ec5cc674ded1","resolution":{"observed_at":"2026-08-04T21:25:29.802763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:29.627766Z","title":"MirrorGAN: Learning Text-To-Image Generation by Redescription","venue":null,"work_id":"b4f22c32-d0a6-4fe0-a612-da9aaac7b541","year":2019},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.087641Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:396fab2aa8a1a56d13fc704adf7f3c3747e2c8f47e6593f9146a37cc28540177","observation_id":"ae62acc3-d4f7-43ab-8426-d82bfc8b4266","resolution":{"observed_at":"2026-08-04T21:25:29.668998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-04T21:25:27.100683Z","title":"Learning Transferable Visual Models From Natural Lan- guage Supervision.ArXiv, 2103.00020, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.100683Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:815d81ca420ffcf87a69d863a453f5c3e459fc0a0b3df56d3fbf18a35840ef79","observation_id":"94515e86-5902-4e92-a229-dc1711ab73c1","resolution":{"observed_at":"2026-08-04T21:25:27.100683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:29.590800Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":null,"work_id":"8220337f-0fc1-48c7-bfd3-5ca1819aedd7","year":2023},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.108332Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:c594de5ff642606d7914f70385317deafca766072697dd01a959f9034c913269","observation_id":"560ca1e8-28fb-46bf-b316-0d2626334408","resolution":{"observed_at":"2026-08-04T21:25:29.604367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-04T21:25:27.114736Z","title":"Zero-Shot Text-to-Image Generation.ArXiv, 2102.12092, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.114736Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:7c2cf02d28f107537a2765554a67d20e823600c3de7601b536fe46e30a0cd55c","observation_id":"e4bfc21b-1c53-4578-98e0-b9f4ab7a1ca6","resolution":{"observed_at":"2026-08-04T21:25:27.114736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-04T21:25:27.120753Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.120753Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:41464279d7fdca93caef5d42e17f66351b5df07156b971ee0e3f4a6ee92696f7","observation_id":"189ec3ff-a078-41c5-bb52-ac6561aa6189","resolution":{"observed_at":"2026-08-04T21:25:27.120753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:29.552062Z","title":"Stable Diffusion, 2021","venue":null,"work_id":"da85d090-ef13-45e9-b47a-a98e31b8a702","year":2021},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.128148Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:edac9da1abbb1d8f1d2479a14a5f56beb7cc0ae3b4b0a2a897d0e8a606021767","observation_id":"cd2fb3e2-711a-4f2f-83cc-c9d162c93154","resolution":{"observed_at":"2026-08-04T21:25:29.560658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-04T21:25:27.135223Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models.ArXiv, 2112.10752, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.135223Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:14454d9674e8fff14036eef30fceeb19f0fe101239361683001b9323a8c96067","observation_id":"b390fbb8-d714-4c5f-b665-0ee1f85481c4","resolution":{"observed_at":"2026-08-04T21:25:27.135223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:29.517365Z","title":"Stable Diffusion v1-5 Model Card, 2024","venue":null,"work_id":"543502d0-b300-4a8f-ab8c-e6e0b94e4bb7","year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.141626Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:d84ff4f50c857214c77d797dd033430d765850e570c185be67ea67118503f6de","observation_id":"876a173b-c180-4813-9a4a-8f98572b99b7","resolution":{"observed_at":"2026-08-04T21:25:29.532726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:29.488711Z","title":"U-Net: Convolutional Net- works for Biomedical Image Segmentation","venue":null,"work_id":"506a9902-d304-465e-8c7c-a8b97ee7ff84","year":2015},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.146424Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:b6b0b595c9a3d1c69b4cbde23fed9f13ed12d28b82f5e190747715dfd7cba3ff","observation_id":"427732d4-70e3-434b-8784-53b9af8ba850","resolution":{"observed_at":"2026-08-04T21:25:29.498665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:29.461651Z","title":"Introducing Gen-3 Alpha: A New Frontier for Video Generation, 2024","venue":null,"work_id":"9cb1c9c9-8a46-4036-ac7d-772ba4ffe98f","year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.151806Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:e05123bdc1e832b1f753709d278a13e0706e4c3547b1c94b7959cd2a7a3f9e4f","observation_id":"f5a8a677-2f4f-4297-aa56-0c07c574c3ff","resolution":{"observed_at":"2026-08-04T21:25:29.468796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:29.439641Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","venue":null,"work_id":"254012e9-0617-4832-b801-b5045f980b6d","year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.157197Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:873dd3ecaefdae3500a3af13dfc3192ee2d89aa16157fc8a38b4c30d2953fe96","observation_id":"580452de-ae29-454a-a195-0e68d6aabc2e","resolution":{"observed_at":"2026-08-04T21:25:29.447853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07927","last_updated":"2025-03-16T06:23:34Z","snapshot_observed_at":"2026-08-05T17:55:26.008016Z","submitted_at":"2024-02-05T19:49:13Z","title":"A Systematic Survey of Prompt Engineering in Large Language Models: Techniques and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07927","snapshot_observed_at":"2026-08-04T21:25:27.165116Z","title":"A Systematic Survey of Prompt Engineering in Large Language Models: Techniques and Applications.ArXiv, 2402.07927, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.165116Z"},"links":{"cited_paper":"/paper/2402.07927","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:3b8d5f010558e74d0c0023c425f4a9f13de7daccfb339801e5c720f027498c04","observation_id":"448a132b-e5c9-440d-8066-d6aa0d5b81b5","resolution":{"observed_at":"2026-08-04T21:25:27.165116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.12625","last_updated":"2022-08-27T00:32:29Z","snapshot_observed_at":"2026-08-05T20:20:01.535124Z","submitted_at":"2021-12-23T15:11:18Z","title":"Comparison and Analysis of Image-to-Image Generative Adversarial Networks: A Survey","version":2},"cited_work":{"arxiv_id":"2112.12625","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.12625","snapshot_observed_at":"2026-08-04T21:25:27.886247Z","title":"Comparison and Analysis of Image-to-Image Generative Adversarial Networks: A Survey","venue":"cs.CV","work_id":"3cb917fe-b586-4812-87c8-65ba59cac69d","year":2021},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.175663Z"},"links":{"cited_paper":"/paper/2112.12625","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:2aa96813a5f8a15665f3342a94c55e5a48e905d5551fb26f34c66011ea75842b","observation_id":"039102f3-8421-4ccd-b322-a7b9d1b4189a","resolution":{"observed_at":"2026-08-04T21:25:27.892925Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:29.420093Z","title":"What is noise?Geophysics, 63(4):1122–1124, 1998","venue":null,"work_id":"230c2e30-aa6f-4757-a4fb-ffac8d6792b4","year":1998},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.182122Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:bb944a5b76a2bd0728850fdd37ed920c7e6a3fa73a94a1c93403086a110604d8","observation_id":"4df9dea7-e41e-41d1-82cf-cc5dbb4adae1","resolution":{"observed_at":"2026-08-04T21:25:29.427153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:29.400324Z","title":"Large pre-trained language models contain human- like biases of what is right and wrong to do.Nature Machine Intelligence, 4:258–268, 2022","venue":null,"work_id":"5d0e09e5-9a8f-483d-8d06-7e5da3e86a22","year":2022},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.188129Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:0861daf393decb7b22f430e3b3c65d9472d6af21d9232525b5beeec4a7dbd9e5","observation_id":"9e8efcb1-4fd6-484c-a962-df22d26cfcad","resolution":{"observed_at":"2026-08-04T21:25:29.406716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:29.374178Z","title":"A comprehensive review of large language models: issues and solutions in learning environments.Discover Sustainability, 6, 2025","venue":null,"work_id":"e3deba67-e683-4abc-9083-346473ff91ff","year":2025},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.193122Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:7fc2528f3ea03416522557b10688de3e195a075f8cf7d6958b2935b108b2492c","observation_id":"ca7199ee-0ff4-4c83-836d-9c28b6654a4b","resolution":{"observed_at":"2026-08-04T21:25:29.386873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.03089","last_updated":"2023-02-27T11:15:40Z","snapshot_observed_at":"2026-07-06T14:14:57.954649Z","submitted_at":"2022-11-06T11:48:20Z","title":"I Hear Your True Colors: Image Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2211.03089","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.03089","snapshot_observed_at":"2026-08-04T21:25:27.854286Z","title":"I Hear Your True Colors: Image Guided Audio Generation","venue":"cs.SD","work_id":"9de49030-b396-4286-b5dd-2e50b2383f01","year":2022},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.198569Z"},"links":{"cited_paper":"/paper/2211.03089","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:96fe1b6a42057dbfbd7d5b240282ae1669203b45e41f4e38990189647c07033f","observation_id":"09179d60-4806-4adb-a7d8-ec64697aef52","resolution":{"observed_at":"2026-08-04T21:25:27.862179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.00443","last_updated":"2021-08-01T12:35:16Z","snapshot_observed_at":"2026-08-08T06:46:37.705481Z","submitted_at":"2021-08-01T12:35:16Z","title":"A Survey on Audio Synthesis and Audio-Visual Multimodal Processing","version":1},"cited_work":{"arxiv_id":"2108.00443","doi":null,"metadata_source":"pith","pith_arxiv_id":"2108.00443","snapshot_observed_at":"2026-08-04T21:25:27.812803Z","title":"A Survey on Audio Synthesis and Audio-Visual Multimodal Processing","venue":"eess.AS","work_id":"84a5a7c1-e0d4-4430-922b-4f5e1bfc624c","year":2021},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.206894Z"},"links":{"cited_paper":"/paper/2108.00443","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:1b61c2964c52e9c0f4ece23d6d79e0e2017bf660b64ab175a7ce842861b8d14a","observation_id":"a0fc0fbc-155f-4321-8f35-c0266598a0db","resolution":{"observed_at":"2026-08-04T21:25:27.823348Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:29.345681Z","title":"Audio-to-Visual Cross-Modal Generation of Birds.IEEE Access, 11:27719–27729, 2023","venue":null,"work_id":"c95dcbc5-24ea-4f31-9299-fd94548a2971","year":2023},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.214946Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:48f3513f8a41c5c532d163e30c76acbeae9dc046b0dd9214717a586a581e6562","observation_id":"d7b109c7-918a-4162-b654-d7f697ebdd39","resolution":{"observed_at":"2026-08-04T21:25:29.353725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:29.316662Z","title":"Outpainting Images and Videos using GANs.International Journal of Computer Trends and Tech- nology, 68(5):24–29, 2020","venue":null,"work_id":"2617c837-0e29-4b71-8aa8-07403862a2de","year":2020},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.221269Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:fd95a8e319312a04b5dd13e3e43da7afb0b319e8b624134146cd4f632e5739ca","observation_id":"9c67e0b6-73e8-4529-9a42-bf3c2d3cf6b2","resolution":{"observed_at":"2026-08-04T21:25:29.323392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:29.286700Z","title":"Pre-trained Speech Processing Models Contain Human-Like Biases that Propagate to Speech Emo- tion Recognition","venue":null,"work_id":"bac7becd-84f9-45d2-93d5-31027a2b64a1","year":2023},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.227831Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:197ae59e87d02872eae891512d6d30f03652e03881569147b84cafc5e9ac830a","observation_id":"8ee53418-5151-4228-92ba-0de62cba72a1","resolution":{"observed_at":"2026-08-04T21:25:29.294833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:29.256104Z","title":"A survey of multimodal deep generative models","venue":null,"work_id":"791e4509-03c5-4e98-b89a-9285119c546d","year":2022},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.234737Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:877a2c177e8dd296bea0ce1fc542d93771face1b7a7c7ab722a3a93369afa48a","observation_id":"e529c811-477d-4dc6-8775-99272ed96449","resolution":{"observed_at":"2026-08-04T21:25:29.262507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18775","last_updated":"2023-11-30T18:21:25Z","snapshot_observed_at":"2026-07-06T16:55:09.267685Z","submitted_at":"2023-11-30T18:21:25Z","title":"CoDi-2: In-Context, Interleaved, and Interactive Any-to-Any Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18775","snapshot_observed_at":"2026-08-04T21:25:27.241054Z","title":"CoDi-2: In-Context, Interleaved, and Interactive Any-to-Any Generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.241054Z"},"links":{"cited_paper":"/paper/2311.18775","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:5bac61dd8d2d2cc76dd72b1f677103a0ab07cf144a31dc347871332eb4c10758","observation_id":"e31a462e-99d7-463c-b0e8-11cae17856c8","resolution":{"observed_at":"2026-08-04T21:25:27.241054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:29.235455Z","title":"Any- to-any generation via composable diffusion","venue":null,"work_id":"2749988d-e44e-412a-a51a-81c9343d2a57","year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.255462Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:d1a23f4e820b38402d5c54e5557287fe166bc9f4c154fec0089bd3a39ed4b64e","observation_id":"1abe22b2-cfb2-4ecf-b81c-80a6af345805","resolution":{"observed_at":"2026-08-04T21:25:29.242371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:29.214478Z","title":"Movie Gen: A Cast of Media Foundation Models, 2024","venue":null,"work_id":"4d67cfe4-3659-436f-a85d-520fc8512133","year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.262025Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:52b3560cce4d78b9ddd13792c27deed882ab86a791c8b2aa664fd84c68eefb0d","observation_id":"13a05cb0-55f7-4dbb-991c-ba76d164d6bf","resolution":{"observed_at":"2026-08-04T21:25:29.222820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-04T21:25:27.268025Z","title":"LLaMA: Open and Efficient Foundation Language Models.ArXiv, 2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.268025Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:9d6dd4f856ec3258aceb6d317f30f8f41d546583ca432b58fb056deb5fac7bab","observation_id":"58e740db-a03e-4fc7-a7ac-05156baf126a","resolution":{"observed_at":"2026-08-04T21:25:27.268025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:29.192031Z","title":"Structural Equation Modeling in Information Systems Research Using Partial Least Squares.Journal of Information Technology Theory and Application, 11(2):5–40, 2010","venue":null,"work_id":"d457b435-2118-4829-8ac1-c10fc605bd06","year":2010},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.274583Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:702e7a77f8521ea71216d295891c9cd5a3e0eb7f403492421ff274fee7bef09a","observation_id":"f6aec77f-4114-4f64-a806-6f059afab01a","resolution":{"observed_at":"2026-08-04T21:25:29.200270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:29.167756Z","title":"Fugatto 1 - Foundational Genera- tive Audio Transformer Opus 1, 2024","venue":null,"work_id":"d37c7a22-54ec-45e1-a5ce-5c275e837803","year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.281670Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:f9887a41992d8eeef604b0a08f898456f1f591edd59e428c55cb462ccb8641be","observation_id":"ef90ac3f-497b-487e-8f25-76419f114f45","resolution":{"observed_at":"2026-08-04T21:25:29.174044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:25:29.146749Z","title":"Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N","venue":null,"work_id":"62fc9006-48c7-4268-8efb-dfa93242e193","year":2017},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.288300Z"},"links":{"citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:22af305c675957d35a5b15b35092681fbe64d78cca0cfc53a9a66c5b8cb36a24","observation_id":"1310c348-71c0-43bc-81d7-ac37937b96b5","resolution":{"observed_at":"2026-08-04T21:25:29.152219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":72,"verified_exact":5,"verified_fuzzy":22},"total_outbound_references":123},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 123 outbound references and 0 inbound Pith citation observations for arXiv:2509.09717."}