Pith. sign in

Paper Citation Record · LEDGER

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language

As of 8 August 2026, this Paper Citation Record lists 97 of 97 outbound references and 0 inbound Pith citation observations for arXiv:2505.17114.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.17114 v3

Coverage vector

measured 97 of 97 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T15:19:17.076699Z

measured 97 of 97 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

97 of 97 outbound references displayed

  • verified exact0
  • verified fuzzy1
  • unresolved96
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 60270654-e41e-4ee8-becf-ed5ee63d9f7b · outbound

This paper cites online" 'onlinestring :=.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language online" 'onlinestring :=

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:10.150160Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:10.150160Z digest=sha256:1f4a773fd732b0c9ed246dd9bc1ce22b09f53e2896d57c19bc03e70675d829c3

Observation e1ddaae8-0ca0-469d-9916-bfabe147bd5c · outbound

This paper cites write newline.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language write newline

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:10.199079Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:10.199079Z digest=sha256:6b3b359e78d87cdb414d05ba37f7b31b64252b5faf4e6f59dfb389e99be08fd8

Observation c86c1d03-18bc-4649-b580-dadb84b2f673 · outbound

This paper cites Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:10.257127Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:10.257127Z digest=sha256:fd89e66d1b8db88217114648ebd93e2bbecd255afc70b55d6b55ed70bc7485e1

Observation 09af562e-cafb-4898-8fa4-df1f83fb1f96 · outbound

This paper cites GPT-4 Technical Report.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language GPT-4 Technical Report

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:10.313328Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:10.313328Z digest=sha256:f6ab673fb1d672feba0d5ffc1e6cec2213623290aa41c5cfb7c50ad2b88c22b5

Observation bdab2514-89fe-47e9-8165-0b1bda8c9235 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:10.364927Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:10.364927Z digest=sha256:b3aace9c692358011066ec55a546f1a5e65f192354c4cac39766551713398158

Observation 100d3978-0016-4e02-aa5e-546d18c0f40f · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:10.413575Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:10.413575Z digest=sha256:d257b591921f020c175bae759bed62957dfc46f020c181b238cb3de9965e2b9d

Observation e1b7fb32-598f-4a26-9f26-d0f393e66276 · outbound

This paper cites OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:10.454123Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:10.454123Z digest=sha256:76028adc96fd7c7e31978022ca59a39c4b393b01f346d967ef5233c78213e756

Observation 787cc205-5044-46c3-ba82-7d24d99337e9 · outbound

This paper cites HierarQ: Task-Aware Hierarchical Q-Former for Enhanced Video Understanding.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language HierarQ: Task-Aware Hierarchical Q-Former for Enhanced Video Understanding

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:10.498757Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:10.498757Z digest=sha256:5817c05c932415e371a58807456f55ae7462c4e2119caea3a492836eae55b163

Observation a7f02d88-bfd8-4cad-b472-73eb87b45caf · outbound

This paper cites Qwen Technical Report.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Qwen Technical Report

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:10.556742Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:10.556742Z digest=sha256:e3c794515545b4d05af73613f81ad6ace636cb1debcdc7c450e1c6d4cbd89523

Observation 8a05cbe8-70be-4d26-ba88-90c6b2fbfe05 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:10.611607Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:10.611607Z digest=sha256:04eef33ec5e1ccd14fb090f6440525d4c6a2cf07958432d9a8bf104b4af92460

Observation fa30bdc1-dd19-48cd-9eb3-5407b43e2a14 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:10.670990Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:10.670990Z digest=sha256:c17e81166387946b31b65c4356b0846a0ecf8aec86e8b37086d22fdadeadad5d

Observation e4003a70-c6c7-4167-a560-4f2cf4abde05 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:10.723052Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:10.723052Z digest=sha256:f02c9d055569faa514907b905c84c62abbefaa952557daf6e440ff4365fc10e0

Observation 14693594-802c-4e94-9741-c60eec63570d · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:10.779736Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:10.779736Z digest=sha256:f2e7da40da404464b2fca0798bfe6f598655c866df5a68de5888c596d13b8593

Observation 49658fb6-cd2a-4651-a162-13bf3b880c0c · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:10.840551Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:10.840551Z digest=sha256:047e6891f534948c636a705321bcef918d58bb00e0dd849c451e47f81a7e6903

Observation 4df0c23c-75af-4104-9e04-af14abb2e49d · outbound

This paper cites BEATs: Audio Pre-Training with Acoustic Tokenizers.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language BEATs: Audio Pre-Training with Acoustic Tokenizers

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:10.885941Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:10.885941Z digest=sha256:5b9adae549bd0de951898ef914d04a734b31220cb65cac31e251445afa4d637c

Observation 0c5d9bd9-5e4e-4e56-85b2-7dc688412b16 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:10.947099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:10.947099Z digest=sha256:3549cd0ac67fa96572a7aaed8e1c2c87d6ceab14aab59b41faaf7699de1ba12a

Observation 48045496-cb93-457c-b317-83fcf1c719f8 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:10.999115Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:10.999115Z digest=sha256:5ac8d7d73cb1f62a0c80a4ae692216006d468d3edb3542da845c7da2c12566b2

Observation 555ec001-e15d-4e98-a4b7-92dc4e01f0eb · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:11.048132Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:11.048132Z digest=sha256:c45025d1b35b282fca962902d01a6940780768cec7ac266fa2ee03b92f2c9c18

Observation 27993793-892b-4755-9dc9-7b1e064af74d · outbound

This paper cites VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:11.106895Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:11.106895Z digest=sha256:956e209bb9167111a537751d3650dd9cbf3d0a9ca2c02b7ad86d86c5bb43ae18

Observation 2e99cf70-eae5-4e1d-af53-d4ffd99ff3d4 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:11.164972Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:11.164972Z digest=sha256:3d2699c12a8de84a56f3ddea61346eee2dc4e0a87c47fbfb0a891ff0b0bbc76c

Observation 315d25b1-5888-4f31-8077-a63d99a5447d · outbound

This paper cites Qwen2-Audio Technical Report.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Qwen2-Audio Technical Report

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:11.220650Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:11.220650Z digest=sha256:7723d776eea280585998dc18d5a5fd318d1923b2a9da60e17b039aa8352ce6f6

Observation 5d85e4e2-74ae-4d9c-bea0-f173e38b0049 · outbound

This paper cites Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:11.270362Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:11.270362Z digest=sha256:62a8a697f38bf0d1c9cb607093f2ade5947fd3c530744d1959b5a141d8d19c2f

Observation 57432296-a529-4d1f-a6d1-aeaaca3a455d · outbound

This paper cites Towards a Personal Health Large Language Model.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Towards a Personal Health Large Language Model

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:11.339063Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:11.339063Z digest=sha256:dc07603a039d267a6fea60214008a648ea4e33fe258129d7060dbb23a97f19b8

Observation 4134502f-1126-43b8-bf2e-b2f6e9c858cc · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:11.385964Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:11.385964Z digest=sha256:0c97de637abde3c332298106fc9654df6d24535afc891108e5b2cd89aca4d5b0

Observation ddc62795-a7f0-473d-8df5-c7fc56f2442d · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:11.428041Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:11.428041Z digest=sha256:6bbdfe32ce3b3e1d37c3a653d6d8a723a62be8e17158a6837ac1c7c88cdaf600

Observation aee99ca5-7d34-4696-9fd1-48e96f329af6 · outbound

This paper cites GPTScore: Evaluate as You Desire.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language GPTScore: Evaluate as You Desire

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:11.478766Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:11.478766Z digest=sha256:5578a2f1256bfbe6c3036a6a82e60936ff1820cd20e6630704df427c93c7cbaa

Observation 60d8575d-1854-44fe-9ec5-42eb2d3ae464 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:11.545258Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:11.545258Z digest=sha256:4e28bab3782904feec2154397eb8d959a81b4b3876062a2d7621c66f65627561

Observation 5927571f-5f58-4c39-acea-e22f53ae50ec · outbound

This paper cites The Llama 3 Herd of Models.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language The Llama 3 Herd of Models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:11.589389Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:11.589389Z digest=sha256:5a3e15f0b9046fb5cd7b584899a4e536690ee80e82ee6aabb864fbcc56159abc

Observation 3aaf3348-e94f-4b56-bb63-92938d5635a6 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:11.640051Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:11.640051Z digest=sha256:9319015d49bbcb62d208d408272ba4b25e3376d423c046a1fd01bec25060a46c

Observation ba2f63f9-ea6c-43fd-b5fc-f2345e7689f7 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:11.696015Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:11.696015Z digest=sha256:14ee7e395215b15c478ec649ba39c4b93506d6872500b2852ffed341778fdc67

Observation 2b411329-e733-45e7-a918-6f53bfcc3f01 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:11.763569Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:11.763569Z digest=sha256:b171faed4c3a5719f5ff766611361527f460380766822493888ebd6b6aeaecb4

Observation c725567d-d2b9-4e23-aa66-c1ba4318c405 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:11.818930Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:11.818930Z digest=sha256:eaeb4f203bf38e1bbdb0fa3b097355c0fa39169719f9071b30b324152537225d

Observation 2f8ea396-0e5f-43c5-bc70-ef67ac90a940 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:11.901638Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:11.901638Z digest=sha256:03e5a24372f9187df672b0a2ec5d5b712a0fdb7b0b1dfd9764c1c3a37c173618

Observation b8cb265d-2a4c-4a32-9870-2ae0eaf35c23 · outbound

This paper cites Mixtral of Experts.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Mixtral of Experts

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:11.961735Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:11.961735Z digest=sha256:8a9a196a70edc9285b3495e5cf17936fb5f4e430d85eed63e1db1446acc86b65

Observation 1c9f78ee-b529-4796-a924-9dd8441422bb · outbound

This paper cites YOLOv11: An Overview of the Key Architectural Enhancements.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language YOLOv11: An Overview of the Key Architectural Enhancements

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:12.029949Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:12.029949Z digest=sha256:73a3bdbf9b51e07849be3ed0f95b9264b6dad4d4a3b6135d737b349a9ba9eaf2

Observation 58501dfe-2b48-405c-bda3-11cef8756e25 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 36

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:19:22.300898Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:19:12.091697Z digest=sha256:749f8d156cd64b6259138a15244b30e14d1dc0f104af628b60ed3941c18aaece

Observation 80032509-7dd9-4cc7-9234-9b8786619388 · outbound

This paper cites Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:12.173201Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:12.173201Z digest=sha256:0d4f9d0863249dbe1a8c26acfd16a19b3fc71c02fb58397563310f61c53cd1b4

Observation 42311a69-aacd-45c5-8c79-ad2a23df74af · outbound

This paper cites Quantifying the Carbon Emissions of Machine Learning.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Quantifying the Carbon Emissions of Machine Learning

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:12.250615Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:12.250615Z digest=sha256:36a24b4b208b1d1aa4114a11633c87f4d73de91780b90f55e677bf3ad120d0a3

Observation de07c6ce-fdee-4512-8319-d2020199fea5 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 39

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:19:22.039753Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:19:12.309132Z digest=sha256:dc2ce53a07cae9765b7f0781f6ecb9d69253d124c8f3bcec5642047811028b16

Observation 9eb00ec5-10fd-444a-978c-0a42bbdb8210 · outbound

This paper cites SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:12.388525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:12.388525Z digest=sha256:bff72637239158de90adeb0237035e5138c31d135c516ad5d83ca1544eaf6432

Observation 00d20fdc-61fc-4c89-ae4d-7f01e87b6dfb · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 41

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:19:21.803377Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:19:12.465897Z digest=sha256:f5f6ac29c7fd0251632a47308fb86c30a8063410e2f8f07905e61ea497fbc354

Observation 2c2e6099-7805-48b4-9ab7-0f3a0ae81d69 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:12.567116Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:12.567116Z digest=sha256:45dd37054bf622895459da145c127c5708509e632094612ff5ccd3a3d9f17723

Observation 0e5514db-3b4e-4cab-9601-15ae7747a2fb · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:12.630876Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:12.630876Z digest=sha256:dd27e8d8044efb3d0c72538d579be4c207de18e92c94dcecbd9a481ac577625c

Observation 98ed9a7a-80ee-42db-9d19-2b2be5e63aed · outbound

This paper cites VideoChat: Chat-Centric Video Understanding.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language VideoChat: Chat-Centric Video Understanding

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:12.678804Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:12.678804Z digest=sha256:de029c0c707d1b1711d12e62111789d9abccf25d4578f28ae34b1df686707115

Observation 0bd26a80-d3a5-4f88-8771-1a903644384c · outbound

This paper cites Video-LLaVA: Learning United Visual Representation by Alignment Before Projection.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Video-LLaVA: Learning United Visual Representation by Alignment Before Projection

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:12.732913Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:12.732913Z digest=sha256:3c951772c62c527128eb3e3bb061c3162d4a446f178f8bf8d73c806ba978ffd0

Observation eb32c950-cdd9-41be-b544-c3ba1b27cd0b · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 46

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:19:21.484441Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:19:12.806322Z digest=sha256:2821dd9fc1923eee4e707a7604936197cd176ffd89adb84019d71f8fe82813ac

Observation 2f2f4e9b-f193-4acc-a993-99bf842dffc2 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:12.864574Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:12.864574Z digest=sha256:e7c402c64e444384a5dab8b2731a1c7da1f123f6ce117ea1e14b2066998a11de

Observation 5f19d872-209a-4e8d-947b-4a1387acb10b · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:12.922133Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:12.922133Z digest=sha256:5fc2ba6cc7fdea3265f5ec704e842c23a6fd604e13ff8914e27864a442f6327b

Observation e23d633b-1be1-43f3-8beb-09cfd2b16521 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:13.018227Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:13.018227Z digest=sha256:a45da91c88b3619c20026c3b26ea3a86f4f9129bbb173d68dab84b6849cd5171

Observation 3d09b4d6-3cac-44c6-9151-4076ef8889fe · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 50

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:19:21.252715Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:19:13.100067Z digest=sha256:b7db0affa608c84a47c253a8b3abca0f3b518d51cbfb6ad1f9a03d3763859ccb

Observation 13fc8891-7b8a-4efc-b6b5-fc1689b8a69c · outbound

This paper cites Valley: Video Assistant with Large Language model Enhanced abilitY.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Valley: Video Assistant with Large Language model Enhanced abilitY

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:13.167183Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:13.167183Z digest=sha256:d171c0a746b2e2ff11d11d5e8761b813cc1d5d0fca8816db75e5827cc6b5265d

Observation 32b933df-fe53-445c-b865-a4551977dff5 · outbound

This paper cites Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:13.241354Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:13.241354Z digest=sha256:37e0c8df0bef6e17293c7362ff24e230d85275e0f3ddfaf38bbc77c21b4c200b

Observation 4644ab99-4b38-4738-abce-95139abc7e52 · outbound

This paper cites Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:13.324395Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:13.324395Z digest=sha256:833fc4821cf41a4625c2671eefeeae27723df9472bb061602b4472a9b63450e0

Observation 688b6eea-a567-486c-9136-4b02fb17cf9e · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 54

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:19:21.107415Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:19:13.408165Z digest=sha256:39740976482f73d834dbbd68492b1752dd0cabc6dec738ced6a0500b050bffa9

Observation 3cedd80c-ef10-40ae-a93d-af37c0d08605 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 55

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:19:20.996076Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:19:13.451601Z digest=sha256:b4c2fa3d7cd648e7f171b7d5aa42df4938f91f9d6ec3f869fbc5a058cecc005b

Observation 3bf3e245-be4c-4bf8-8af3-56de3fd64769 · outbound

This paper cites Transforming Wearable Data into Personal Health Insights using Large Language Model Agents.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Transforming Wearable Data into Personal Health Insights using Large Language Model Agents

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:13.520338Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:13.520338Z digest=sha256:fbbbcc98b2277d4209e36caa562c53df1d6a4628e11c0f03d41fffb835762c26

Observation 983c3dbe-cf5e-4db3-b374-e595ea9e935d · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 57

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:19:20.863080Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:19:13.573783Z digest=sha256:259dce8cd343e30e796e04b40936a439c1a41b93546a1a48c293ff91e8c3984f

Observation 7e3d9130-d0e5-4f3d-9329-9d1912b3023f · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 58

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:19:20.735214Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:19:13.641245Z digest=sha256:9f7ea29f37562e7e6c599c752a95813a893d7b2d6c30402a0b8541e1fe393142

Observation 3819ec86-0a09-421f-ba59-106138e2d44f · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 59

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:19:20.610623Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:19:13.668186Z digest=sha256:b280f017cfbea30e0678fb1ee73aa8afb2d42bcdebe9591025257cb9e16d1cc0

Observation 01cb448f-6921-49a3-81a5-5f80ef60c883 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 60

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:19:20.467076Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:19:13.693026Z digest=sha256:2313f413032db463aebd400174edcd0fd323c1e04eab1cd17bdee9c8b6af2d89

Observation 5020a5fa-c442-4c7f-9704-7a12e80101c3 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 61

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:19:20.388830Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:19:13.737710Z digest=sha256:7f9f92e90f352deb9e309fb522219b276b12916b111072328d871457634455ad

Observation 86382666-eb74-43d0-9ada-b1e2f2a1e48d · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:13.813348Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:13.813348Z digest=sha256:ceda0799e495473351b51c0b708565ad2668f55ddc46672a281602b78b1bbbef

Observation 213828d9-88bd-4a93-9460-7dad9ccdac75 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 63

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:19:20.241513Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:19:13.868351Z digest=sha256:1ad1e1ef7b24abc4b28cd4d4883978f1c737e17ac6b1aa8ee93efe0cee3a351e

Observation 1a83c1eb-43da-4198-9b0e-deab20fca1ea · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 64

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:19:20.137570Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:19:13.912583Z digest=sha256:b201dc26994b501d14744ac3bc87924a944d5a95751a9d5c60ff7a0ba15fb8e0

Observation 1576259e-4dea-4f50-9d7a-242bcc91f326 · outbound

This paper cites o rster, Gerhard Tr \.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language o rster, Gerhard Tr \

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:19:19.993853Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:19:13.999784Z digest=sha256:e6526446468e69bda72083be47ee000c1e5494d56223485011205353d5656d7c

Observation cb33b572-1263-4710-b296-84f34917d826 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 66

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:19:19.866797Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:19:14.037010Z digest=sha256:6ab738929f5b7c12e249bd1c966764872b3b71dc3c8f098d0a6374dcdc340116

Observation 9e79c0e2-fdf6-45ea-910e-0fcd9692b7ae · outbound

This paper cites Audio-Visual LLM for Video Understanding.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Audio-Visual LLM for Video Understanding

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:14.093875Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:14.093875Z digest=sha256:8b67f5f7879d40a62787a24f1d0d95b53e3e8b34b7ea48ca3d9f62b14aa23d8d

Observation ff76576b-9867-4c88-9564-651d95c28b0c · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 68

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:19:19.756502Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:19:14.164631Z digest=sha256:8deedb0599cfd22e767fcb365188829095f51eb777b9460aa174f6b5617b7e29

Observation d22ccb91-849a-4457-aa58-1983c39c197f · outbound

This paper cites PandaGPT: One Model To Instruction-Follow Them All.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language PandaGPT: One Model To Instruction-Follow Them All

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:14.206661Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:14.206661Z digest=sha256:1eec2b728f32c55d52aee3db837e2aa69d76979db176908e84f5dd7aca382f35

Observation 749b412a-2359-446e-b454-ab461c87c42f · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:14.314884Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:14.314884Z digest=sha256:aad8908b2a99cc9e679909bc36ff27661f60eed1eb31cca6701b55cf35621a7e

Observation ae81651a-c55f-4394-8c92-77abfee5b48e · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Gemini: A Family of Highly Capable Multimodal Models

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:14.426375Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:14.426375Z digest=sha256:f2a307e3c209c5f808869e100b86bcab0638d5f46c29c4c7891e5880ce40a59d

Observation 86210f5b-0117-40fe-ba75-c1c6aece745a · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language LLaMA: Open and Efficient Foundation Language Models

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:14.537539Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:14.537539Z digest=sha256:0574839cf30175b11c9e1c97e92f38540258a4f81958b4b4f235f80ac3fd3bf6

Observation 9d853ae4-95f6-4259-8d0f-1a50cfb4d80b · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:14.644361Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:14.644361Z digest=sha256:027ac6a88c67c2163da318b6bdd0f2f0e0b59cd342707b0b052c96a8017957f1

Observation 84d0a368-14ef-4891-a2f1-96f6416fa13c · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 74

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:19:19.630248Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:19:14.759628Z digest=sha256:b01e4b5778c0a59bc47b5ec656c1b2d096a05f963d270566ad6645de7a7f57b0

Observation 42352660-1d21-46ab-8edc-e8126a2874be · outbound

This paper cites InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:14.859109Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:14.859109Z digest=sha256:4bbb42f77a7f7805f940267c2c6d2e6d04936b44d14aa1bbf44b1a5c9c651f65

Observation f6e27c0f-96e2-42d8-a695-f1e3d8be7a8c · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 76

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:19:19.494680Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:19:14.992047Z digest=sha256:b767092d0e3b4f88c0ae267a83b4501aeb13905dbd2c44e5f0ef962d21f0e39c

Observation 88437df4-fe30-49ef-99a3-5f0df4f11919 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:15.118921Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:15.118921Z digest=sha256:f4660b26eb48563024edf40348df8a0c4699f1fb0dddd02b173ff44004dde36d

Observation 68ddd567-afad-4899-899d-6d36937dbfea · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 78

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:19:19.371144Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:19:15.232414Z digest=sha256:659a6b971f5fe1f617fe47e82e0cc5ece8a2ab39183e0f95636713cf00f2087b

Observation 1cfec381-dc52-4c1c-b54c-d70c9922f2c6 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 79

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:19:19.243999Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:19:15.353797Z digest=sha256:dcbbbb1b3828b7e3f0a1d26e7bbaa86b4b1877a9636efee23e4ffe9d2b815e53

Observation 67aa12ed-846d-476b-9315-18b0a5cba9f8 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:15.479576Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:15.479576Z digest=sha256:a8519c19ebd4b97ecd5116b33c412475159525fc724bf346a7a25748bdc540f4

Observation 793c47e5-88e4-4661-af9e-605fb9fe3cd3 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 81

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:19:19.112945Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:19:15.636303Z digest=sha256:1f52aa7e16333f48247179fd31431b8c3d7de3c347df7c10a52f41720c3cc204

Observation 04e92110-129c-480d-a037-36062323f4f7 · outbound

This paper cites Qwen2.5 Technical Report.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Qwen2.5 Technical Report

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:15.769573Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:15.769573Z digest=sha256:cf4e31b0ee02ba37cd0ecb234d16d3c77df80b4f9ffa47395ae8e9d878195fa4

Observation f8c362a3-3a51-445e-85a6-c4d8ea538ed7 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 83

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:19:18.969998Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:19:15.936528Z digest=sha256:0b05d09dc94bdd13f48bb8cd572ebfc426f35d6e40efc2c6b9450b50000c6558

Observation 9d521d6d-a866-4b45-b9b7-f271b658c00b · outbound

This paper cites FILIP: Fine-grained Interactive Language-Image Pre-Training.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language FILIP: Fine-grained Interactive Language-Image Pre-Training

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:15.993448Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:15.993448Z digest=sha256:19e9b717788973d74f783f2463e0b7d8ac0cdcb2c855d88abfadc1d3bf02925c

Observation 6c494ba1-dcda-4fb4-94f3-cb94560ffa83 · outbound

This paper cites X-VILA: Cross-Modality Alignment for Large Language Model.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language X-VILA: Cross-Modality Alignment for Large Language Model

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:16.066143Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:16.066143Z digest=sha256:2939f2a76e689b3334eb38c389eec28c09f618c1fa13683590c773307ee7bff3

Observation 4eb1aa6e-cd7e-41d0-9fcd-f78c5317b8be · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 86

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:19:18.674353Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:19:16.182274Z digest=sha256:b205758d5fbc5d4b7179ec26285f8a4e9bdeaa92a7cd71fe320ce7be3783c618

Observation e1a91857-7e1c-46b3-8a20-6041460a5d5b · outbound

This paper cites CoCa: Contrastive Captioners are Image-Text Foundation Models.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language CoCa: Contrastive Captioners are Image-Text Foundation Models

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:16.271301Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:16.271301Z digest=sha256:8897173c2bc360c0705c6e68a0b593f941a2659652703e3823111b05c114a861

Observation 5ae2b931-bf7a-43ac-8493-e71d435ff2e7 · outbound

This paper cites MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:16.368854Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:16.368854Z digest=sha256:32def36eead0e590cbf341c568855a5a83f4adf6ccc0ba72e5cbb1cda280a164

Observation dda167e7-bd0d-48fc-8cf9-9e54a76c75ed · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 89

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:16.432288Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:16.432288Z digest=sha256:2744feea65c70aeb1cd02753226919b9c1b86bee574fccc16e4ca73ab72465dd

Observation 3fbcf2ea-4efc-4d61-ad2b-9bfef46d2328 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:16.517800Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:16.517800Z digest=sha256:eb81664b11a6e6b31c440498fad934b8c145426bce3cabbd319b81ef2acf933c

Observation 93472509-6f12-41bb-86ac-2c194cf69b1c · outbound

This paper cites Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:16.548292Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:16.548292Z digest=sha256:c6361962ad0728e80144457ffdfd6e85d496a5f21bf0ac9f82c0b65a0c012a8b

Observation bb24375f-0db0-43a7-97d1-158a09d07da2 · outbound

This paper cites LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:16.624441Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:16.624441Z digest=sha256:fa0b25b4e038520edefc6b5f3b0e42e7c06ced12128ac044bd7407b40b84bc8a

Observation 33bc38ee-b3f8-4fa7-b5bc-cc9936aea120 · outbound

This paper cites OPT: Open Pre-trained Transformer Language Models.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language OPT: Open Pre-trained Transformer Language Models

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:16.684351Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:16.684351Z digest=sha256:07cfc00afd81e91db698d45d73e4de39b42768a37dc4b1f778b894e1edcebb84

Observation 2ef65dd1-116e-48cc-87d2-08fc9a1edf07 · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 94

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:19:18.425823Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:19:16.717714Z digest=sha256:02d6394bc6979a4e919ebc49a42609f21afb2c9ff552c41bb5f6c4e1cb75cdba

Observation f331fe9b-d24a-4211-a67f-aefb2181970c · outbound

This paper cites an unresolved cited work.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language Unresolved cited work

Reference 95

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:19:18.170866Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:19:16.825291Z digest=sha256:4b3fb5466d39bd24951872705dba6b57d99e97a302af36b31f28c735dd6d155a

Observation c970c1a9-af25-4ead-82ff-2c7a6769158e · outbound

This paper cites LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment

Reference 96

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:16.974837Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:16.974837Z digest=sha256:918e23d52cc8f4942501ecc4251a83128e17f6453bdd669a1fe4a69f80a6734e

Observation 2b3daa6b-841f-43ce-9ccb-1ca96cf3d280 · outbound

This paper cites MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models.

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-07T15:19:17.076699Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:19:17.076699Z digest=sha256:4a99cc190be49a31d0e3b7580fabeb15b19b2fea2b5a33ba7bcb81488ae6bcd1

Pith citing papers

No inbound Pith citation observations are available.