{"as_of":"2026-08-08T23:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ba55173478f56bb725369450d9ff94ac39af13f15a1115ffb577e55c716ce50d","coverage":[{"denominator":97,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":97,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:19:17.076699Z","state":"measured"},{"denominator":97,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":97,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.17114/citation-record","integrity":"/paper/2505.17114/integrity","json":"/paper/2505.17114/citation-record.json","paper":"/paper/2505.17114"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:10.150160Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:10.150160Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:1f4a773fd732b0c9ed246dd9bc1ce22b09f53e2896d57c19bc03e70675d829c3","observation_id":"60270654-e41e-4ee8-becf-ed5ee63d9f7b","resolution":{"observed_at":"2026-08-07T15:19:10.150160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:10.199079Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:10.199079Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:6b3b359e78d87cdb414d05ba37f7b31b64252b5faf4e6f59dfb389e99be08fd8","observation_id":"e1ddaae8-0ca0-469d-9916-bfabe147bd5c","resolution":{"observed_at":"2026-08-07T15:19:10.199079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T15:19:10.257127Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:10.257127Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:fd89e66d1b8db88217114648ebd93e2bbecd255afc70b55d6b55ed70bc7485e1","observation_id":"c86c1d03-18bc-4649-b580-dadb84b2f673","resolution":{"observed_at":"2026-08-07T15:19:10.257127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T15:19:10.313328Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:10.313328Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:f6ab673fb1d672feba0d5ffc1e6cec2213623290aa41c5cfb7c50ad2b88c22b5","observation_id":"09af562e-cafb-4898-8fa4-df1f83fb1f96","resolution":{"observed_at":"2026-08-07T15:19:10.313328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:10.364927Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:10.364927Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:b3aace9c692358011066ec55a546f1a5e65f192354c4cac39766551713398158","observation_id":"bdab2514-89fe-47e9-8165-0b1bda8c9235","resolution":{"observed_at":"2026-08-07T15:19:10.364927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:10.413575Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:10.413575Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:d257b591921f020c175bae759bed62957dfc46f020c181b238cb3de9965e2b9d","observation_id":"100d3978-0016-4e02-aa5e-546d18c0f40f","resolution":{"observed_at":"2026-08-07T15:19:10.413575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-07T15:19:10.454123Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:10.454123Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:76028adc96fd7c7e31978022ca59a39c4b393b01f346d967ef5233c78213e756","observation_id":"e1b7fb32-598f-4a26-9f26-d0f393e66276","resolution":{"observed_at":"2026-08-07T15:19:10.454123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08585","last_updated":"2025-04-24T17:42:16Z","snapshot_observed_at":"2026-08-07T18:43:01.306583Z","submitted_at":"2025-03-11T16:21:23Z","title":"HierarQ: Task-Aware Hierarchical Q-Former for Enhanced Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08585","snapshot_observed_at":"2026-08-07T15:19:10.498757Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:10.498757Z"},"links":{"cited_paper":"/paper/2503.08585","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:5817c05c932415e371a58807456f55ae7462c4e2119caea3a492836eae55b163","observation_id":"787cc205-5044-46c3-ba82-7d24d99337e9","resolution":{"observed_at":"2026-08-07T15:19:10.498757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T15:19:10.556742Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:10.556742Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:e3c794515545b4d05af73613f81ad6ace636cb1debcdc7c450e1c6d4cbd89523","observation_id":"a7f02d88-bfd8-4cad-b472-73eb87b45caf","resolution":{"observed_at":"2026-08-07T15:19:10.556742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:10.611607Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:10.611607Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:04eef33ec5e1ccd14fb090f6440525d4c6a2cf07958432d9a8bf104b4af92460","observation_id":"8a05cbe8-70be-4d26-ba88-90c6b2fbfe05","resolution":{"observed_at":"2026-08-07T15:19:10.611607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:10.670990Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:10.670990Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:c17e81166387946b31b65c4356b0846a0ecf8aec86e8b37086d22fdadeadad5d","observation_id":"fa30bdc1-dd19-48cd-9eb3-5407b43e2a14","resolution":{"observed_at":"2026-08-07T15:19:10.670990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:10.723052Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:10.723052Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:f02c9d055569faa514907b905c84c62abbefaa952557daf6e440ff4365fc10e0","observation_id":"e4003a70-c6c7-4167-a560-4f2cf4abde05","resolution":{"observed_at":"2026-08-07T15:19:10.723052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:10.779736Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:10.779736Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:f2e7da40da404464b2fca0798bfe6f598655c866df5a68de5888c596d13b8593","observation_id":"14693594-802c-4e94-9741-c60eec63570d","resolution":{"observed_at":"2026-08-07T15:19:10.779736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:10.840551Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:10.840551Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:047e6891f534948c636a705321bcef918d58bb00e0dd849c451e47f81a7e6903","observation_id":"49658fb6-cd2a-4651-a162-13bf3b880c0c","resolution":{"observed_at":"2026-08-07T15:19:10.840551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-07T15:19:10.885941Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:10.885941Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:5b9adae549bd0de951898ef914d04a734b31220cb65cac31e251445afa4d637c","observation_id":"4df0c23c-75af-4104-9e04-af14abb2e49d","resolution":{"observed_at":"2026-08-07T15:19:10.885941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:10.947099Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:10.947099Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:3549cd0ac67fa96572a7aaed8e1c2c87d6ceab14aab59b41faaf7699de1ba12a","observation_id":"0c5d9bd9-5e4e-4e56-85b2-7dc688412b16","resolution":{"observed_at":"2026-08-07T15:19:10.947099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:10.999115Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:10.999115Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:5ac8d7d73cb1f62a0c80a4ae692216006d468d3edb3542da845c7da2c12566b2","observation_id":"48045496-cb93-457c-b317-83fcf1c719f8","resolution":{"observed_at":"2026-08-07T15:19:10.999115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:11.048132Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:11.048132Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:c45025d1b35b282fca962902d01a6940780768cec7ac266fa2ee03b92f2c9c18","observation_id":"555ec001-e15d-4e98-a4b7-92dc4e01f0eb","resolution":{"observed_at":"2026-08-07T15:19:11.048132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T15:19:11.106895Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:11.106895Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:956e209bb9167111a537751d3650dd9cbf3d0a9ca2c02b7ad86d86c5bb43ae18","observation_id":"27993793-892b-4755-9dc9-7b1e064af74d","resolution":{"observed_at":"2026-08-07T15:19:11.106895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:11.164972Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:11.164972Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:3d2699c12a8de84a56f3ddea61346eee2dc4e0a87c47fbfb0a891ff0b0bbc76c","observation_id":"2e99cf70-eae5-4e1d-af53-d4ffd99ff3d4","resolution":{"observed_at":"2026-08-07T15:19:11.164972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T15:19:11.220650Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:11.220650Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:7723d776eea280585998dc18d5a5fd318d1923b2a9da60e17b039aa8352ce6f6","observation_id":"315d25b1-5888-4f31-8077-a63d99a5447d","resolution":{"observed_at":"2026-08-07T15:19:11.220650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-07T15:19:11.270362Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:11.270362Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:62a8a697f38bf0d1c9cb607093f2ade5947fd3c530744d1959b5a141d8d19c2f","observation_id":"5d85e4e2-74ae-4d9c-bea0-f173e38b0049","resolution":{"observed_at":"2026-08-07T15:19:11.270362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06474","last_updated":"2024-06-10T17:16:49Z","snapshot_observed_at":"2026-07-06T18:28:16.301122Z","submitted_at":"2024-06-10T17:16:49Z","title":"Towards a Personal Health Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06474","snapshot_observed_at":"2026-08-07T15:19:11.339063Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:11.339063Z"},"links":{"cited_paper":"/paper/2406.06474","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:dc07603a039d267a6fea60214008a648ea4e33fe258129d7060dbb23a97f19b8","observation_id":"57432296-a529-4d1f-a6d1-aeaaca3a455d","resolution":{"observed_at":"2026-08-07T15:19:11.339063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:11.385964Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:11.385964Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:0c97de637abde3c332298106fc9654df6d24535afc891108e5b2cd89aca4d5b0","observation_id":"4134502f-1126-43b8-bf2e-b2f6e9c858cc","resolution":{"observed_at":"2026-08-07T15:19:11.385964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:11.428041Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:11.428041Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:6bbdfe32ce3b3e1d37c3a653d6d8a723a62be8e17158a6837ac1c7c88cdaf600","observation_id":"ddc62795-a7f0-473d-8df5-c7fc56f2442d","resolution":{"observed_at":"2026-08-07T15:19:11.428041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04166","last_updated":"2023-02-13T16:19:05Z","snapshot_observed_at":"2026-08-05T08:58:00.258106Z","submitted_at":"2023-02-08T16:17:29Z","title":"GPTScore: Evaluate as You Desire","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04166","snapshot_observed_at":"2026-08-07T15:19:11.478766Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:11.478766Z"},"links":{"cited_paper":"/paper/2302.04166","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:5578a2f1256bfbe6c3036a6a82e60936ff1820cd20e6630704df427c93c7cbaa","observation_id":"aee99ca5-7d34-4696-9fd1-48e96f329af6","resolution":{"observed_at":"2026-08-07T15:19:11.478766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:11.545258Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:11.545258Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:4e28bab3782904feec2154397eb8d959a81b4b3876062a2d7621c66f65627561","observation_id":"60d8575d-1854-44fe-9ec5-42eb2d3ae464","resolution":{"observed_at":"2026-08-07T15:19:11.545258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:19:11.589389Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:11.589389Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:5a3e15f0b9046fb5cd7b584899a4e536690ee80e82ee6aabb864fbcc56159abc","observation_id":"5927571f-5f58-4c39-acea-e22f53ae50ec","resolution":{"observed_at":"2026-08-07T15:19:11.589389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:11.640051Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:11.640051Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:9319015d49bbcb62d208d408272ba4b25e3376d423c046a1fd01bec25060a46c","observation_id":"3aaf3348-e94f-4b56-bb63-92938d5635a6","resolution":{"observed_at":"2026-08-07T15:19:11.640051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:11.696015Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:11.696015Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:14ee7e395215b15c478ec649ba39c4b93506d6872500b2852ffed341778fdc67","observation_id":"ba2f63f9-ea6c-43fd-b5fc-f2345e7689f7","resolution":{"observed_at":"2026-08-07T15:19:11.696015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:11.763569Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:11.763569Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:b171faed4c3a5719f5ff766611361527f460380766822493888ebd6b6aeaecb4","observation_id":"2b411329-e733-45e7-a918-6f53bfcc3f01","resolution":{"observed_at":"2026-08-07T15:19:11.763569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:11.818930Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:11.818930Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:eaeb4f203bf38e1bbdb0fa3b097355c0fa39169719f9071b30b324152537225d","observation_id":"c725567d-d2b9-4e23-aa66-c1ba4318c405","resolution":{"observed_at":"2026-08-07T15:19:11.818930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:11.901638Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:11.901638Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:03e5a24372f9187df672b0a2ec5d5b712a0fdb7b0b1dfd9764c1c3a37c173618","observation_id":"2f8ea396-0e5f-43c5-bc70-ef67ac90a940","resolution":{"observed_at":"2026-08-07T15:19:11.901638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-07T15:19:11.961735Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:11.961735Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:8a9a196a70edc9285b3495e5cf17936fb5f4e430d85eed63e1db1446acc86b65","observation_id":"b8cb265d-2a4c-4a32-9870-2ae0eaf35c23","resolution":{"observed_at":"2026-08-07T15:19:11.961735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17725","last_updated":"2024-10-23T09:55:22Z","snapshot_observed_at":"2026-07-06T19:38:22.461739Z","submitted_at":"2024-10-23T09:55:22Z","title":"YOLOv11: An Overview of the Key Architectural Enhancements","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17725","snapshot_observed_at":"2026-08-07T15:19:12.029949Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:12.029949Z"},"links":{"cited_paper":"/paper/2410.17725","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:73a3bdbf9b51e07849be3ed0f95b9264b6dad4d4a3b6135d737b349a9ba9eaf2","observation_id":"1c9f78ee-b529-4796-a924-9dd8441422bb","resolution":{"observed_at":"2026-08-07T15:19:12.029949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:22.180889Z","title":null,"venue":null,"work_id":"17478554-2511-410b-937c-912448ec3a8e","year":2019},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:12.091697Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:749f8d156cd64b6259138a15244b30e14d1dc0f104af628b60ed3941c18aaece","observation_id":"58501dfe-2b48-405c-bda3-11cef8756e25","resolution":{"observed_at":"2026-08-07T15:19:22.300898Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01831","last_updated":"2024-05-28T05:44:53Z","snapshot_observed_at":"2026-08-07T19:26:44.980429Z","submitted_at":"2024-02-02T18:58:34Z","title":"Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01831","snapshot_observed_at":"2026-08-07T15:19:12.173201Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:12.173201Z"},"links":{"cited_paper":"/paper/2402.01831","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:0d4f9d0863249dbe1a8c26acfd16a19b3fc71c02fb58397563310f61c53cd1b4","observation_id":"80032509-7dd9-4cc7-9234-9b8786619388","resolution":{"observed_at":"2026-08-07T15:19:12.173201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09700","last_updated":"2019-11-04T20:37:33Z","snapshot_observed_at":"2026-07-06T08:31:12.309726Z","submitted_at":"2019-10-21T23:57:32Z","title":"Quantifying the Carbon Emissions of Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.09700","snapshot_observed_at":"2026-08-07T15:19:12.250615Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:12.250615Z"},"links":{"cited_paper":"/paper/1910.09700","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:36a24b4b208b1d1aa4114a11633c87f4d73de91780b90f55e677bf3ad120d0a3","observation_id":"42311a69-aacd-45c5-8c79-ad2a23df74af","resolution":{"observed_at":"2026-08-07T15:19:12.250615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:21.913604Z","title":null,"venue":null,"work_id":"da093f87-d690-4729-bbd0-6d78aff0fdc4","year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:12.309132Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:dc2ce53a07cae9765b7f0781f6ecb9d69253d124c8f3bcec5642047811028b16","observation_id":"de07c6ce-fdee-4512-8319-d2020199fea5","resolution":{"observed_at":"2026-08-07T15:19:22.039753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T15:19:12.388525Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:12.388525Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:bff72637239158de90adeb0237035e5138c31d135c516ad5d83ca1544eaf6432","observation_id":"9eb00ec5-10fd-444a-978c-0a42bbdb8210","resolution":{"observed_at":"2026-08-07T15:19:12.388525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:21.704721Z","title":null,"venue":null,"work_id":"b52115d5-7ff1-4d06-9490-28eb28021b88","year":2022},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:12.465897Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:f5f6ac29c7fd0251632a47308fb86c30a8063410e2f8f07905e61ea497fbc354","observation_id":"00d20fdc-61fc-4c89-ae4d-7f01e87b6dfb","resolution":{"observed_at":"2026-08-07T15:19:21.803377Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:12.567116Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:12.567116Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:45dd37054bf622895459da145c127c5708509e632094612ff5ccd3a3d9f17723","observation_id":"2c2e6099-7805-48b4-9ab7-0f3a0ae81d69","resolution":{"observed_at":"2026-08-07T15:19:12.567116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:12.630876Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:12.630876Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:dd27e8d8044efb3d0c72538d579be4c207de18e92c94dcecbd9a481ac577625c","observation_id":"0e5514db-3b4e-4cab-9601-15ae7747a2fb","resolution":{"observed_at":"2026-08-07T15:19:12.630876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T15:19:12.678804Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:12.678804Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:de029c0c707d1b1711d12e62111789d9abccf25d4578f28ae34b1df686707115","observation_id":"98ed9a7a-80ee-42db-9d19-2b2be5e63aed","resolution":{"observed_at":"2026-08-07T15:19:12.678804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T15:19:12.732913Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:12.732913Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:3c951772c62c527128eb3e3bb061c3162d4a446f178f8bf8d73c806ba978ffd0","observation_id":"0bd26a80-d3a5-4f88-8771-1a903644384c","resolution":{"observed_at":"2026-08-07T15:19:12.732913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:21.402275Z","title":null,"venue":null,"work_id":"fcf88fca-bb31-455a-a009-a28dca0c53c3","year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:12.806322Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:2821dd9fc1923eee4e707a7604936197cd176ffd89adb84019d71f8fe82813ac","observation_id":"eb32c950-cdd9-41be-b544-c3ba1b27cd0b","resolution":{"observed_at":"2026-08-07T15:19:21.484441Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:12.864574Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:12.864574Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:e7c402c64e444384a5dab8b2731a1c7da1f123f6ce117ea1e14b2066998a11de","observation_id":"2f2f4e9b-f193-4acc-a993-99bf842dffc2","resolution":{"observed_at":"2026-08-07T15:19:12.864574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:12.922133Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:12.922133Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:5fc2ba6cc7fdea3265f5ec704e842c23a6fd604e13ff8914e27864a442f6327b","observation_id":"5f19d872-209a-4e8d-947b-4a1387acb10b","resolution":{"observed_at":"2026-08-07T15:19:12.922133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:13.018227Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:13.018227Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:a45da91c88b3619c20026c3b26ea3a86f4f9129bbb173d68dab84b6849cd5171","observation_id":"e23d633b-1be1-43f3-8beb-09cfd2b16521","resolution":{"observed_at":"2026-08-07T15:19:13.018227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:21.190445Z","title":null,"venue":null,"work_id":"101f8eda-423a-4628-83c8-daa20c21d01e","year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:13.100067Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:b7db0affa608c84a47c253a8b3abca0f3b518d51cbfb6ad1f9a03d3763859ccb","observation_id":"3d09b4d6-3cac-44c6-9151-4076ef8889fe","resolution":{"observed_at":"2026-08-07T15:19:21.252715Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-07T15:19:13.167183Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:13.167183Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:d171c0a746b2e2ff11d11d5e8761b813cc1d5d0fca8816db75e5827cc6b5265d","observation_id":"13fc8891-7b8a-4efc-b6b5-fc1689b8a69c","resolution":{"observed_at":"2026-08-07T15:19:13.167183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-07T15:19:13.241354Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:13.241354Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:37e0c8df0bef6e17293c7362ff24e230d85275e0f3ddfaf38bbc77c21b4c200b","observation_id":"32b933df-fe53-445c-b865-a4551977dff5","resolution":{"observed_at":"2026-08-07T15:19:13.241354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-07T15:19:13.324395Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:13.324395Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:833fc4821cf41a4625c2671eefeeae27723df9472bb061602b4472a9b63450e0","observation_id":"4644ab99-4b38-4738-abce-95139abc7e52","resolution":{"observed_at":"2026-08-07T15:19:13.324395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:21.058224Z","title":null,"venue":null,"work_id":"a1606f59-5206-46de-a165-1f03ce6ec640","year":2019},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:13.408165Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:39740976482f73d834dbbd68492b1752dd0cabc6dec738ced6a0500b050bffa9","observation_id":"688b6eea-a567-486c-9136-4b02fb17cf9e","resolution":{"observed_at":"2026-08-07T15:19:21.107415Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:20.946896Z","title":null,"venue":null,"work_id":"032f8655-94a0-4dbf-b309-e1b7ecf77525","year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:13.451601Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:b4c2fa3d7cd648e7f171b7d5aa42df4938f91f9d6ec3f869fbc5a058cecc005b","observation_id":"3cedd80c-ef10-40ae-a93d-af37c0d08605","resolution":{"observed_at":"2026-08-07T15:19:20.996076Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06464","last_updated":"2025-09-08T17:59:48Z","snapshot_observed_at":"2026-07-06T18:28:16.301122Z","submitted_at":"2024-06-10T17:00:54Z","title":"Transforming Wearable Data into Personal Health Insights using Large Language Model Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06464","snapshot_observed_at":"2026-08-07T15:19:13.520338Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:13.520338Z"},"links":{"cited_paper":"/paper/2406.06464","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:fbbbcc98b2277d4209e36caa562c53df1d6a4628e11c0f03d41fffb835762c26","observation_id":"3bf3e245-be4c-4bf8-8af3-56de3fd64769","resolution":{"observed_at":"2026-08-07T15:19:13.520338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:20.804229Z","title":null,"venue":null,"work_id":"24dfa2b7-6f90-4328-91bc-da35038d1764","year":2022},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:13.573783Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:259dce8cd343e30e796e04b40936a439c1a41b93546a1a48c293ff91e8c3984f","observation_id":"983c3dbe-cf5e-4db3-b374-e595ea9e935d","resolution":{"observed_at":"2026-08-07T15:19:20.863080Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:20.681738Z","title":null,"venue":null,"work_id":"a2395ff3-a8b4-458c-a2f9-f8c45a885f72","year":2021},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:13.641245Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:9f7ea29f37562e7e6c599c752a95813a893d7b2d6c30402a0b8541e1fe393142","observation_id":"7e3d9130-d0e5-4f3d-9329-9d1912b3023f","resolution":{"observed_at":"2026-08-07T15:19:20.735214Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:20.536486Z","title":null,"venue":null,"work_id":"3b55d158-df23-49df-a4cb-faf857b6f4dd","year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:13.668186Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:b280f017cfbea30e0678fb1ee73aa8afb2d42bcdebe9591025257cb9e16d1cc0","observation_id":"3819ec86-0a09-421f-ba59-106138e2d44f","resolution":{"observed_at":"2026-08-07T15:19:20.610623Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:20.438985Z","title":null,"venue":null,"work_id":"4a4f99ab-0406-462f-a4b0-b65681db3178","year":2011},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:13.693026Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:2313f413032db463aebd400174edcd0fd323c1e04eab1cd17bdee9c8b6af2d89","observation_id":"01cb448f-6921-49a3-81a5-5f80ef60c883","resolution":{"observed_at":"2026-08-07T15:19:20.467076Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:20.342086Z","title":null,"venue":null,"work_id":"b483af04-8f83-4141-bf7a-c00ee376c586","year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:13.737710Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:7f9f92e90f352deb9e309fb522219b276b12916b111072328d871457634455ad","observation_id":"5020a5fa-c442-4c7f-9704-7a12e80101c3","resolution":{"observed_at":"2026-08-07T15:19:20.388830Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:13.813348Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:13.813348Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:ceda0799e495473351b51c0b708565ad2668f55ddc46672a281602b78b1bbbef","observation_id":"86382666-eb74-43d0-9ada-b1e2f2a1e48d","resolution":{"observed_at":"2026-08-07T15:19:13.813348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:20.193241Z","title":null,"venue":null,"work_id":"4f61e2df-3fe3-4ba9-ad2f-f0f5226cfd46","year":2020},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:13.868351Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:1ad1e1ef7b24abc4b28cd4d4883978f1c737e17ac6b1aa8ee93efe0cee3a351e","observation_id":"213828d9-88bd-4a93-9460-7dad9ccdac75","resolution":{"observed_at":"2026-08-07T15:19:20.241513Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:20.097756Z","title":null,"venue":null,"work_id":"4a792cce-5226-4946-be41-9f0c6586d784","year":2016},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:13.912583Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:b201dc26994b501d14744ac3bc87924a944d5a95751a9d5c60ff7a0ba15fb8e0","observation_id":"1a83c1eb-43da-4198-9b0e-deab20fca1ea","resolution":{"observed_at":"2026-08-07T15:19:20.137570Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:19.942369Z","title":"o rster, Gerhard Tr \\","venue":null,"work_id":"10b0b11d-fd04-4653-ba30-f984b76de7e2","year":2010},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:13.999784Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:e6526446468e69bda72083be47ee000c1e5494d56223485011205353d5656d7c","observation_id":"1576259e-4dea-4f50-9d7a-242bcc91f326","resolution":{"observed_at":"2026-08-07T15:19:19.993853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:19.818069Z","title":null,"venue":null,"work_id":"5fdf0b31-4f58-442b-9302-ebf751213be9","year":2014},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:14.037010Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:6ab738929f5b7c12e249bd1c966764872b3b71dc3c8f098d0a6374dcdc340116","observation_id":"cb33b572-1263-4710-b296-84f34917d826","resolution":{"observed_at":"2026-08-07T15:19:19.866797Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-08-07T15:19:14.093875Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:14.093875Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:8b67f5f7879d40a62787a24f1d0d95b53e3e8b34b7ea48ca3d9f62b14aa23d8d","observation_id":"9e79c0e2-fdf6-45ea-910e-0fcd9692b7ae","resolution":{"observed_at":"2026-08-07T15:19:14.093875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:19.712557Z","title":null,"venue":null,"work_id":"14143eca-3a06-49b4-94ae-97718170f0ec","year":2015},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:14.164631Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:8deedb0599cfd22e767fcb365188829095f51eb777b9460aa174f6b5617b7e29","observation_id":"ff76576b-9867-4c88-9564-651d95c28b0c","resolution":{"observed_at":"2026-08-07T15:19:19.756502Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16355","last_updated":"2023-05-25T04:16:07Z","snapshot_observed_at":"2026-08-02T07:50:35.580500Z","submitted_at":"2023-05-25T04:16:07Z","title":"PandaGPT: One Model To Instruction-Follow Them All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16355","snapshot_observed_at":"2026-08-07T15:19:14.206661Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:14.206661Z"},"links":{"cited_paper":"/paper/2305.16355","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:1eec2b728f32c55d52aee3db837e2aa69d76979db176908e84f5dd7aca382f35","observation_id":"d22ccb91-849a-4457-aa58-1983c39c197f","resolution":{"observed_at":"2026-08-07T15:19:14.206661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:14.314884Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:14.314884Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:aad8908b2a99cc9e679909bc36ff27661f60eed1eb31cca6701b55cf35621a7e","observation_id":"749b412a-2359-446e-b454-ab461c87c42f","resolution":{"observed_at":"2026-08-07T15:19:14.314884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T15:19:14.426375Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:14.426375Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:f2a307e3c209c5f808869e100b86bcab0638d5f46c29c4c7891e5880ce40a59d","observation_id":"ae81651a-c55f-4394-8c92-77abfee5b48e","resolution":{"observed_at":"2026-08-07T15:19:14.426375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T15:19:14.537539Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:14.537539Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:0574839cf30175b11c9e1c97e92f38540258a4f81958b4b4f235f80ac3fd3bf6","observation_id":"86210f5b-0117-40fe-ba75-c1c6aece745a","resolution":{"observed_at":"2026-08-07T15:19:14.537539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:14.644361Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:14.644361Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:027ac6a88c67c2163da318b6bdd0f2f0e0b59cd342707b0b052c96a8017957f1","observation_id":"9d853ae4-95f6-4259-8d0f-1a50cfb4d80b","resolution":{"observed_at":"2026-08-07T15:19:14.644361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:19.572777Z","title":null,"venue":null,"work_id":"7117b666-98c4-4e3c-9f90-f4541b686a33","year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:14.759628Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:b01e4b5778c0a59bc47b5ec656c1b2d096a05f963d270566ad6645de7a7f57b0","observation_id":"84d0a368-14ef-4891-a2f1-96f6416fa13c","resolution":{"observed_at":"2026-08-07T15:19:19.630248Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-07T15:19:14.859109Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:14.859109Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:4bbb42f77a7f7805f940267c2c6d2e6d04936b44d14aa1bbf44b1a5c9c651f65","observation_id":"42352660-1d21-46ab-8edc-e8126a2874be","resolution":{"observed_at":"2026-08-07T15:19:14.859109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:19.451249Z","title":null,"venue":null,"work_id":"9b83aba8-84eb-4564-a796-b69893a8a855","year":2025},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:14.992047Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:b767092d0e3b4f88c0ae267a83b4501aeb13905dbd2c44e5f0ef962d21f0e39c","observation_id":"f6e27c0f-96e2-42d8-a695-f1e3d8be7a8c","resolution":{"observed_at":"2026-08-07T15:19:19.494680Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:15.118921Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:15.118921Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:f4660b26eb48563024edf40348df8a0c4699f1fb0dddd02b173ff44004dde36d","observation_id":"88437df4-fe30-49ef-99a3-5f0df4f11919","resolution":{"observed_at":"2026-08-07T15:19:15.118921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:19.319720Z","title":null,"venue":null,"work_id":"a20ba3bb-8f2a-4049-ba84-6ab715e60ceb","year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:15.232414Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:659a6b971f5fe1f617fe47e82e0cc5ece8a2ab39183e0f95636713cf00f2087b","observation_id":"68ddd567-afad-4899-899d-6d36937dbfea","resolution":{"observed_at":"2026-08-07T15:19:19.371144Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:19.191519Z","title":null,"venue":null,"work_id":"b582f603-f384-4496-a2fa-1c9e25162218","year":2021},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:15.353797Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:dcbbbb1b3828b7e3f0a1d26e7bbaa86b4b1877a9636efee23e4ffe9d2b815e53","observation_id":"1cfec381-dc52-4c1c-b54c-d70c9922f2c6","resolution":{"observed_at":"2026-08-07T15:19:19.243999Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:15.479576Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:15.479576Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:a8519c19ebd4b97ecd5116b33c412475159525fc724bf346a7a25748bdc540f4","observation_id":"67aa12ed-846d-476b-9315-18b0a5cba9f8","resolution":{"observed_at":"2026-08-07T15:19:15.479576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:19.066722Z","title":null,"venue":null,"work_id":"61a0c85d-9fd3-4c6f-93a2-60b830263ba8","year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:15.636303Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:1f52aa7e16333f48247179fd31431b8c3d7de3c347df7c10a52f41720c3cc204","observation_id":"793c47e5-88e4-4661-af9e-605fb9fe3cd3","resolution":{"observed_at":"2026-08-07T15:19:19.112945Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T15:19:15.769573Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:15.769573Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:cf4e31b0ee02ba37cd0ecb234d16d3c77df80b4f9ffa47395ae8e9d878195fa4","observation_id":"04e92110-129c-480d-a037-36062323f4f7","resolution":{"observed_at":"2026-08-07T15:19:15.769573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:18.815275Z","title":null,"venue":null,"work_id":"1188cf9b-1ac8-4e1d-a0c0-1e3ba811f330","year":2022},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:15.936528Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:0b05d09dc94bdd13f48bb8cd572ebfc426f35d6e40efc2c6b9450b50000c6558","observation_id":"f8c362a3-3a51-445e-85a6-c4d8ea538ed7","resolution":{"observed_at":"2026-08-07T15:19:18.969998Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-07T15:19:15.993448Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:15.993448Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:19e9b717788973d74f783f2463e0b7d8ac0cdcb2c855d88abfadc1d3bf02925c","observation_id":"9d521d6d-a866-4b45-b9b7-f271b658c00b","resolution":{"observed_at":"2026-08-07T15:19:15.993448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19335","last_updated":"2024-05-29T17:59:58Z","snapshot_observed_at":"2026-08-01T16:34:38.923197Z","submitted_at":"2024-05-29T17:59:58Z","title":"X-VILA: Cross-Modality Alignment for Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19335","snapshot_observed_at":"2026-08-07T15:19:16.066143Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:16.066143Z"},"links":{"cited_paper":"/paper/2405.19335","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:2939f2a76e689b3334eb38c389eec28c09f618c1fa13683590c773307ee7bff3","observation_id":"6c494ba1-dcda-4fb4-94f3-cb94560ffa83","resolution":{"observed_at":"2026-08-07T15:19:16.066143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:18.588901Z","title":null,"venue":null,"work_id":"c0e2115c-3052-467d-a1a6-859e6293500c","year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:16.182274Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:b205758d5fbc5d4b7179ec26285f8a4e9bdeaa92a7cd71fe320ce7be3783c618","observation_id":"4eb1aa6e-cd7e-41d0-9fcd-f78c5317b8be","resolution":{"observed_at":"2026-08-07T15:19:18.674353Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-07T15:19:16.271301Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:16.271301Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:8897173c2bc360c0705c6e68a0b593f941a2659652703e3823111b05c114a861","observation_id":"e1a91857-7e1c-46b3-8a20-6041460a5d5b","resolution":{"observed_at":"2026-08-07T15:19:16.271301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-07T15:19:16.368854Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:16.368854Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:32def36eead0e590cbf341c568855a5a83f4adf6ccc0ba72e5cbb1cda280a164","observation_id":"5ae2b931-bf7a-43ac-8493-e71d435ff2e7","resolution":{"observed_at":"2026-08-07T15:19:16.368854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:16.432288Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:16.432288Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:2744feea65c70aeb1cd02753226919b9c1b86bee574fccc16e4ca73ab72465dd","observation_id":"dda167e7-bd0d-48fc-8cf9-9e54a76c75ed","resolution":{"observed_at":"2026-08-07T15:19:16.432288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:16.517800Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:16.517800Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:eb81664b11a6e6b31c440498fad934b8c145426bce3cabbd319b81ef2acf933c","observation_id":"3fbcf2ea-4efc-4d61-ad2b-9bfef46d2328","resolution":{"observed_at":"2026-08-07T15:19:16.517800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-07T15:19:16.548292Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:16.548292Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:c6361962ad0728e80144457ffdfd6e85d496a5f21bf0ac9f82c0b65a0c012a8b","observation_id":"93472509-6f12-41bb-86ac-2c194cf69b1c","resolution":{"observed_at":"2026-08-07T15:19:16.548292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-07T15:19:16.624441Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:16.624441Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:fa0b25b4e038520edefc6b5f3b0e42e7c06ced12128ac044bd7407b40b84bc8a","observation_id":"bb24375f-0db0-43a7-97d1-158a09d07da2","resolution":{"observed_at":"2026-08-07T15:19:16.624441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-07T15:19:16.684351Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:16.684351Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:07cfc00afd81e91db698d45d73e4de39b42768a37dc4b1f778b894e1edcebb84","observation_id":"33bc38ee-b3f8-4fa7-b5bc-cc9936aea120","resolution":{"observed_at":"2026-08-07T15:19:16.684351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:18.306160Z","title":null,"venue":null,"work_id":"77a96590-4cf8-479c-917d-51b199caaa10","year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:16.717714Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:02d6394bc6979a4e919ebc49a42609f21afb2c9ff552c41bb5f6c4e1cb75cdba","observation_id":"2ef65dd1-116e-48cc-87d2-08fc9a1edf07","resolution":{"observed_at":"2026-08-07T15:19:18.425823Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:19:18.107212Z","title":null,"venue":null,"work_id":"72ac7b69-f51e-454c-b103-d28d36cfa02a","year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:16.825291Z"},"links":{"citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:4b3fb5466d39bd24951872705dba6b57d99e97a302af36b31f28c735dd6d155a","observation_id":"f331fe9b-d24a-4211-a67f-aefb2181970c","resolution":{"observed_at":"2026-08-07T15:19:18.170866Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01852","last_updated":"2024-01-22T03:11:15Z","snapshot_observed_at":"2026-08-07T05:10:33.059352Z","submitted_at":"2023-10-03T07:33:27Z","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01852","snapshot_observed_at":"2026-08-07T15:19:16.974837Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:16.974837Z"},"links":{"cited_paper":"/paper/2310.01852","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:918e23d52cc8f4942501ecc4251a83128e17f6453bdd669a1fe4a69f80a6734e","observation_id":"c970c1a9-af25-4ead-82ff-2c7a6769158e","resolution":{"observed_at":"2026-08-07T15:19:16.974837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T15:19:17.076699Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:17.076699Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:4a99cc190be49a31d0e3b7580fabeb15b19b2fea2b5a33ba7bcb81488ae6bcd1","observation_id":"2b3daa6b-841f-43ce-9ccb-1ca96cf3d280","resolution":{"observed_at":"2026-08-07T15:19:17.076699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language"},"reference_resolution":{"displayed":97,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":96,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":97},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 97 of 97 outbound references and 0 inbound Pith citation observations for arXiv:2505.17114."}