{"as_of":"2026-08-07T23:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fb78bc3a6739aee9341b7669a6fc850534bb26022dadedb44546e0be00dddb25","coverage":[{"denominator":127,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:49:53.545730Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:41:05.001058Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-28T19:22:34.453758Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07016","snapshot_observed_at":"2026-08-06T22:41:05.001058Z","title":"Magnet: A multi-agent framework for finding audio-visual needles by reasoning over multi-video haystacks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:05.001058Z"},"links":{"cited_paper":"/paper/2506.07016","citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:4903244a8087da8095793a0e3c2c6c14ae77ba9421244b7a3813d359baf67136","observation_id":"b7e657f6-9660-4ad7-a8ed-513e02acdef8","resolution":{"observed_at":"2026-08-06T22:41:05.001058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"cited_work":{"arxiv_id":"2506.07016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07016","snapshot_observed_at":"2026-06-28T19:22:34.453758Z","title":"Magnet: A multi-agent framework for finding audio-visual needles by reasoning over multi-video haystacks","venue":null,"work_id":"a88798e2-13cf-46c6-a1e2-2046f9e2c31d","year":2025},"citing_paper":{"arxiv_id":"2602.14122","last_updated":"2026-04-18T15:08:17Z","snapshot_observed_at":"2026-08-02T05:18:20.195131Z","submitted_at":"2026-02-15T12:46:35Z","title":"EgoSound: Benchmarking Sound Understanding in Egocentric Videos","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T21:44:47.636912Z"},"links":{"cited_paper":"/paper/2506.07016","citing_paper":"/paper/2602.14122"},"observation_digest":"sha256:be4e28ca796633662ad7ad3cb34178b29c0e6bd5d1cb1e17e41d871f0736ec71","observation_id":"dbe2db90-2cb4-4672-b286-ff4a14a70b56","resolution":{"observed_at":"2026-05-15T21:46:42.485110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"cited_work":{"arxiv_id":"2506.07016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07016","snapshot_observed_at":"2026-06-28T19:22:34.453758Z","title":"Magnet: A multi-agent framework for finding audio-visual needles by reasoning over multi-video haystacks","venue":null,"work_id":"a88798e2-13cf-46c6-a1e2-2046f9e2c31d","year":2025},"citing_paper":{"arxiv_id":"2606.00592","last_updated":"2026-05-30T07:44:52Z","snapshot_observed_at":"2026-08-02T05:52:22.485746Z","submitted_at":"2026-05-30T07:44:52Z","title":"Through the PRISM: Principle-Aware, Interpretable, and Multi-Scale Evaluation of Visual Designs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T19:19:09.199731Z"},"links":{"cited_paper":"/paper/2506.07016","citing_paper":"/paper/2606.00592"},"observation_digest":"sha256:06daa5e02c8c2f925c8ee0b9d84428f312606a2cd024f8c9e67914fb4c1a0428","observation_id":"ea59bb54-f6e6-48c1-b475-63155e155898","resolution":{"observed_at":"2026-06-28T19:22:34.455260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07016/citation-record","integrity":"/paper/2506.07016/integrity","json":"/paper/2506.07016/citation-record.json","paper":"/paper/2506.07016"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.13068","last_updated":"2025-03-17T11:19:03Z","snapshot_observed_at":"2026-08-07T16:58:15.380194Z","submitted_at":"2025-03-17T11:19:03Z","title":"Crab: A Unified Audio-Visual Scene Understanding Model with Explicit Cooperation","version":1},"cited_work":{"arxiv_id":"2503.13068","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13068","snapshot_observed_at":"2026-08-07T05:49:54.266142Z","title":"Crab: A Unified Audio-Visual Scene Understanding Model with Explicit Cooperation","venue":"cs.CV","work_id":"cc5d08c3-8694-4a65-9989-da9f40af3197","year":2025},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.235638Z"},"links":{"cited_paper":"/paper/2503.13068","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:3c91859823c89f3b4ab3dfea6227f0a5857e45f6f6146cc43a812bf3b09d2cf7","observation_id":"c9c349f6-6edd-46a0-bdcb-665277de79c7","resolution":{"observed_at":"2026-08-07T05:49:54.269852Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.239537Z","title":"Meerkat: Audio-visual large language model for grounding in space and time","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.239537Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:d4fddafc1ef3f33adfa662ab23665bc016238a15308366185fd182c84d100411","observation_id":"ae26d71d-10cd-4f1b-987c-f9fc48a03f20","resolution":{"observed_at":"2026-08-07T05:49:53.239537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-07-06T18:58:56.504337Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-07T05:49:53.242431Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.242431Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:1114c5177c320c7debb20434d33802acee372e327500b28629b0be010a4939bf","observation_id":"6fbb984b-5ef9-49ec-abb0-41193774fd76","resolution":{"observed_at":"2026-08-07T05:49:53.242431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.245607Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision language audio and action","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.245607Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:c1eaf10d022333c0a3871267605bf4bc371af9b52e54e5636fd1b6d312e70d67","observation_id":"9281e5fc-12a0-44b1-b467-6ee8a1b32bbc","resolution":{"observed_at":"2026-08-07T05:49:53.245607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05889","last_updated":"2025-03-20T02:27:50Z","snapshot_observed_at":"2026-07-06T17:27:37.212340Z","submitted_at":"2024-02-08T18:27:22Z","title":"CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular Fusion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05889","snapshot_observed_at":"2026-08-07T05:49:53.248569Z","title":"Crema: Generalizable and efficient video-language reasoning via multimodal modular fusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.248569Z"},"links":{"cited_paper":"/paper/2402.05889","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:75b210ae7a321ca5aa00f477bbe8bf204ca997cb533ed0f0a9030b93a67a9f71","observation_id":"cb2ada9f-3ebe-453f-974a-ce660e33b6ce","resolution":{"observed_at":"2026-08-07T05:49:53.248569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.251727Z","title":"Avicuna: Audio-visual llm with interleaver and context-boundary alignment for temporal referential dialogue","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.251727Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:c4dec5679fdc95c7a564ef9fd0e452ac596a7f0905279e8ca343544a539ed936","observation_id":"07fa958e-1721-4972-a904-1b52d70a42c5","resolution":{"observed_at":"2026-08-07T05:49:53.251727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-07T05:49:53.267029Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.267029Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:48d9651f4435f593916469488accb5918c2f92c8a9e0cdb56b2f860da6668542","observation_id":"2aa1aa53-cd40-479c-b381-cab4192fa0bd","resolution":{"observed_at":"2026-08-07T05:49:53.267029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.270357Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.270357Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:62cec1c8c4fe05b3ec557c99ce95440cc9a3473b9ef3aa2e910eb285c6b44318","observation_id":"ffb5b741-b0a6-47a7-9850-a1b6c96facdf","resolution":{"observed_at":"2026-08-07T05:49:53.270357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08813","last_updated":"2024-10-21T03:08:08Z","snapshot_observed_at":"2026-08-07T17:42:30.374808Z","submitted_at":"2024-05-14T17:59:02Z","title":"CinePile: A Long Video Question Answering Dataset and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08813","snapshot_observed_at":"2026-08-07T05:49:53.273176Z","title":"Cinepile: A long video question answering dataset and benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.273176Z"},"links":{"cited_paper":"/paper/2405.08813","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:58c1242878169b35766c1d9a5d2cc79fb78a0b95638aed710a04b9cfc561b7bf","observation_id":"a55a95d4-5a08-4bdb-a540-3c8398416327","resolution":{"observed_at":"2026-08-07T05:49:53.273176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.279518Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.279518Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:740a07894acf96f574fcb74dcecc36f212dce7e8220bb3d47e47fb810ac77c67","observation_id":"b68cb8c7-9fec-421a-85ad-614890e1b7d6","resolution":{"observed_at":"2026-08-07T05:49:53.279518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.281960Z","title":"Dense-localizing audio-visual events in untrimmed videos: A large-scale benchmark and baseline","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.281960Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:739c2a8e96c11462af45ef2737db0bf07cbdf568d01c487dd49d0b2f33840f2e","observation_id":"0642fdb3-3293-452d-aace-d241ec4e6a73","resolution":{"observed_at":"2026-08-07T05:49:53.281960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.284473Z","title":"Vast: A vision-audio-subtitle-text omni-modality foundation model and dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.284473Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:0d60cc08901ccc9665096243c803c71d4698e5dc6ea7ebe40330995371b36864","observation_id":"28cd0823-f30f-498c-9861-143eb3a8bc9f","resolution":{"observed_at":"2026-08-07T05:49:53.284473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.287137Z","title":"Avqa: A dataset for audio-visual question answering on videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.287137Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:4a334ff2dacca8d9f7ddd075265731f9ceeea80cfda7ea9e33792b462bf4e9e3","observation_id":"2f204c4f-25e5-4659-bdd6-a4b9f95b604a","resolution":{"observed_at":"2026-08-07T05:49:53.287137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.290455Z","title":"Cat: Enhancing multimodal large language model to answer questions in dynamic audio-visual scenarios","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.290455Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:ab12268e9405eaf395d81ed8ac909507aa462d988cc3877d3877d1523fb77272","observation_id":"e8a4da05-4271-4769-9f0e-d9b74fa231d7","resolution":{"observed_at":"2026-08-07T05:49:53.290455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.293237Z","title":"Learning to answer questions in dynamic audio-visual scenarios","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.293237Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:6c0e554af474146553c061d660bef11875abf4e9cea7fcc9843abc00f19c6ddb","observation_id":"86e2d76f-14bd-411b-a289-923b64fd4cb2","resolution":{"observed_at":"2026-08-07T05:49:53.293237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.296583Z","title":"Vggsound: A large-scale audio- visual dataset","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.296583Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:76ae5ef9f70ef25f962db4f8491d682d4bd3710a1a4357251dd020b80b73cad2","observation_id":"2b52dfc9-6683-4c2b-abb7-c81cab78b27a","resolution":{"observed_at":"2026-08-07T05:49:53.296583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16213","last_updated":"2024-12-10T19:43:46Z","snapshot_observed_at":"2026-07-06T19:56:25.704753Z","submitted_at":"2024-11-25T09:22:13Z","title":"SAVEn-Vid: Synergistic Audio-Visual Integration for Enhanced Understanding in Long Video Context","version":2},"cited_work":{"arxiv_id":"2411.16213","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.16213","snapshot_observed_at":"2026-08-07T05:49:54.210292Z","title":"SAVEn-Vid: Synergistic Audio-Visual Integration for Enhanced Understanding in Long Video Context","venue":"cs.CV","work_id":"b0bc7851-a635-48f1-9ebe-8571f58d075c","year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.299116Z"},"links":{"cited_paper":"/paper/2411.16213","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:7a547e5431c5947234493d81a560b0a6e3227fa009d4e19b0ca5cc6e2bc2f7f6","observation_id":"74a42b6f-062f-4581-8e7b-74b0436b721c","resolution":{"observed_at":"2026-08-07T05:49:54.215338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.302017Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.302017Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:4bbe58abe4a5b4c15e9b48c8fcf384f84db1f2f4cfb2446028235a1ef03ba657","observation_id":"9743a3e4-b48c-45de-a516-1a9cbe36c5de","resolution":{"observed_at":"2026-08-07T05:49:53.302017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.305234Z","title":"Gemini: Google’s multimodal ai model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.305234Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:814ab4f92d06560363f71c4702353df9974af1dffc5b349e79a62ec8dbf4548a","observation_id":"fd4a3517-5586-4f10-a753-2a6c64bfd37b","resolution":{"observed_at":"2026-08-07T05:49:53.305234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T05:49:53.307666Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.307666Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:093eb68e1e198636c2774ed4f0f044266a8c566b9c7a31189b90ba2bbad0bc97","observation_id":"14d0b676-6f3f-4568-95a6-a122675a9208","resolution":{"observed_at":"2026-08-07T05:49:53.307666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T05:49:53.310525Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.310525Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:43387ac3e247b3723326ed2f0d7e3775b77be4830b60868cb3f91d958bacbdf9","observation_id":"d21a88a6-d50d-4291-8c0a-83ba536d916d","resolution":{"observed_at":"2026-08-07T05:49:53.310525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03281","last_updated":"2023-08-07T03:52:59Z","snapshot_observed_at":"2026-08-04T23:10:23.964516Z","submitted_at":"2023-08-07T03:52:59Z","title":"Towards General Text Embeddings with Multi-stage Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03281","snapshot_observed_at":"2026-08-07T05:49:53.313653Z","title":"Towards general text embeddings with multi-stage contrastive learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.313653Z"},"links":{"cited_paper":"/paper/2308.03281","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:e20e9cde55c556121297a9f5b210decaf5e50fbbc7fe896576713fe05d1524c3","observation_id":"43ef4468-98cc-4c9e-9be2-577564468c64","resolution":{"observed_at":"2026-08-07T05:49:53.313653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.316432Z","title":"Variants of the hungarian method for assignment problems","venue":null,"work_id":null,"year":1956},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.316432Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:8960e322d595861b214ef2ea72bfa59c3641a53101f208800b09f4e8f80244d5","observation_id":"0cc2a8d5-55cd-4c78-9013-06881199978f","resolution":{"observed_at":"2026-08-07T05:49:53.316432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.319165Z","title":"Video-rag: Visually-aligned retrieval-augmented long video comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.319165Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:10ce0d79275c6d28d924b069cae3fde16351da09ef7455f891ea1caf306538b3","observation_id":"c9527294-ac5e-4fa7-bc35-06407f19f055","resolution":{"observed_at":"2026-08-07T05:49:53.319165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-08-07T05:49:53.321734Z","title":"video-salmonn: Speech-enhanced audio-visual large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.321734Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:0cbb1dff8c2609a1b6e13493f59f6f6664c861d16c986bbb3b1c19ebe913b811","observation_id":"75b41b82-8f33-443b-a107-50688a16e005","resolution":{"observed_at":"2026-08-07T05:49:53.321734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.324462Z","title":"High-fidelity audio compression with improved rvqgan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.324462Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:e48a83bdba62373f0544b535888fc17cc84ddd6facce084de207303055ac9bd0","observation_id":"861d624e-75d6-47de-be27-79ed826e7e49","resolution":{"observed_at":"2026-08-07T05:49:53.324462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T05:49:53.326881Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.326881Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:0777ed424232a098fc97b3954cc00d326ecfdd7944e1a3d14106738f82f9d9d5","observation_id":"4faf8e1e-e314-4294-9137-d87b8caf369f","resolution":{"observed_at":"2026-08-07T05:49:53.326881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T05:49:53.329657Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.329657Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:8bf281c549b3e7e3d0ac003056bec28e9192c915f76310920245219edb7398e4","observation_id":"521efbb0-9174-4f8f-9d04-0aca524bec44","resolution":{"observed_at":"2026-08-07T05:49:53.329657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.332855Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.332855Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:3f9b7039744aa23d5f062bfa7169fee4353f3f10ee220d7ba1ccdf61bd3a4b84","observation_id":"64c22047-d71b-4f29-9eed-692710e1357a","resolution":{"observed_at":"2026-08-07T05:49:53.332855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.01225","last_updated":"2022-11-02T05:25:06Z","snapshot_observed_at":"2026-07-30T11:11:52.165985Z","submitted_at":"2022-03-02T16:34:09Z","title":"Video Question Answering: Datasets, Algorithms and Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.01225","snapshot_observed_at":"2026-08-07T05:49:53.335527Z","title":"Video question answering: Datasets, algorithms and challenges","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.335527Z"},"links":{"cited_paper":"/paper/2203.01225","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:3204d36713c28c4098fca68fefddc597a56279d56f3156d05e627f5c09c9af29","observation_id":"1e9f3a76-d7a7-4118-adb0-2a0b0df3377f","resolution":{"observed_at":"2026-08-07T05:49:53.335527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-05T10:34:24.268925Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-07T05:49:53.338244Z","title":"Lvbench: An extreme long video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.338244Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:b835e9f4aa884bae54333967bf2c386994bfe13e373d40b8ecf2ee62e3770e7b","observation_id":"d005edee-7e59-453d-a80b-70df346af50f","resolution":{"observed_at":"2026-08-07T05:49:53.338244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.341351Z","title":"Movieqa: Understanding stories in movies through question-answering","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.341351Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:e517d365507b79d6fe37f96f9978d708b51936bd2c8001b84343e3b6bc75ccdd","observation_id":"44fd02b2-02c6-4094-a565-5d80afc81ff9","resolution":{"observed_at":"2026-08-07T05:49:53.341351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.344344Z","title":"Are we asking the right questions in movieqa? In Proceedings of the IEEE/CVF International Conference on Computer Vision Workshops, pages 0–0, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.344344Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:d579328930b98e9205dad7bea3b18680fb225754aa5c5e50a75c3805139acb56","observation_id":"1e25c88d-2c88-4a7a-9074-80b411e855b5","resolution":{"observed_at":"2026-08-07T05:49:53.344344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.347140Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.347140Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:aaa7bec6a7c800c692e2a458570e0a30814ce5ed223af59a768dc6d558093892","observation_id":"e13897b5-9982-4b69-b512-dcf1b32f27c5","resolution":{"observed_at":"2026-08-07T05:49:53.347140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00347","last_updated":"2018-12-07T07:03:52Z","snapshot_observed_at":"2026-08-04T13:33:48.224677Z","submitted_at":"2018-11-01T12:47:11Z","title":"How2: A Large-scale Dataset for Multimodal Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00347","snapshot_observed_at":"2026-08-07T05:49:53.349615Z","title":"How2: a large-scale dataset for multimodal language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.349615Z"},"links":{"cited_paper":"/paper/1811.00347","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:8bbb478894a5a624b7e2b3f7cb138298128f99e4d8dba555d9ee2a54aa9548a5","observation_id":"04042d7a-4529-42c6-add3-d490954fb018","resolution":{"observed_at":"2026-08-07T05:49:53.349615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.352727Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.352727Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:a1d33fd459eb1ef5da9bcc6475fd0762a240adad91a477c78396553543e47aa6","observation_id":"dd516ceb-d6e4-4528-8a6e-b47a87b04001","resolution":{"observed_at":"2026-08-07T05:49:53.352727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.354968Z","title":"Perception test: A diagnostic benchmark for multimodal video models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.354968Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:05df6383386ed664068200c106853892d18da6091e2527a727c41d2f5c75a70f","observation_id":"4de816fd-bc2a-4bcb-90f1-f11d582fca64","resolution":{"observed_at":"2026-08-07T05:49:53.354968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-03T10:25:11.936842Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-07T05:49:53.357596Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.357596Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:059cf74a0bda302b0cc821a7aace7c35ca066e03f37a1ccdebc8eb8275047442","observation_id":"28fd6f61-85cf-4000-9df3-5bdea4755f80","resolution":{"observed_at":"2026-08-07T05:49:53.357596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.360494Z","title":"Agqa: A benchmark for compositional spatio-temporal reasoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.360494Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:6f9eefe5b1cbc676fa3d7bd5a4a585ca23f8a7fd32c8aa5cce01a569e69f06a2","observation_id":"c14e6391-f72e-47a3-9cbe-5663d75b4092","resolution":{"observed_at":"2026-08-07T05:49:53.360494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.363689Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.363689Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:f6e209d6468eaa443f9f856822205ec0d8d4086ee7f42ad0adaf174822344cd4","observation_id":"dfa4da0a-2546-47a2-9d07-f89a2ae3df00","resolution":{"observed_at":"2026-08-07T05:49:53.363689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.366642Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.366642Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:a988d70dd81f57da7e39208a841fbb94ded588d50d00eb0f8c4eea7015c325fa","observation_id":"4129b2ae-f882-4af7-9895-bbe0823ac0cb","resolution":{"observed_at":"2026-08-07T05:49:53.366642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.369194Z","title":"Just ask: Learning to answer questions from millions of narrated videos","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.369194Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:037283c1ea8132a9016ff28e3574494e1bad07c418ca3873c5c456d2a282f696","observation_id":"c8204057-19fa-4593-b216-cc2fbaa405a1","resolution":{"observed_at":"2026-08-07T05:49:53.369194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05040","last_updated":"2025-06-30T07:41:07Z","snapshot_observed_at":"2026-08-07T16:07:58.938906Z","submitted_at":"2025-04-07T13:05:09Z","title":"InstructionBench: An Instructional Video Understanding Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05040","snapshot_observed_at":"2026-08-07T05:49:53.372532Z","title":"Instructionbench: An instructional video understanding benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.372532Z"},"links":{"cited_paper":"/paper/2504.05040","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:d2716588074c6fbc700d3814646d894069aff2d9fb4d317513c9d572fc804cce","observation_id":"b3a54a4b-e9d3-4d54-a0b1-7cbe0b1e541f","resolution":{"observed_at":"2026-08-07T05:49:53.372532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-05T14:19:26.939328Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04144","snapshot_observed_at":"2026-08-07T05:49:53.375278Z","title":"Hd-epic: A highly-detailed egocentric video dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.375278Z"},"links":{"cited_paper":"/paper/2502.04144","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:110b0a181b7d79905902010627ad27a8e02e06cd0449c69bdb084b6ed121759d","observation_id":"cb94633a-c344-46d0-a195-ee1cbbcc352c","resolution":{"observed_at":"2026-08-07T05:49:53.375278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.378573Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.378573Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:81259628fdf644e3eae64e260d70e5eb93f18ea019b7929e15caa857ce635521","observation_id":"7fa9c4d4-f755-44ca-9822-11dfc0246416","resolution":{"observed_at":"2026-08-07T05:49:53.378573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.381710Z","title":"Ego-exo4d: Understand- ing skilled human activity from first-and third-person perspectives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.381710Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:d68926fa0cc3be28c82405fc5a77a13f13c5030a35fe0f8d171803a4624b4b4d","observation_id":"812bdbe8-357f-4318-92ae-ef9fe1546578","resolution":{"observed_at":"2026-08-07T05:49:53.381710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.384201Z","title":"Scaling egocentric vision: The epic-kitchens dataset","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.384201Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:c8c8960b54180a159986cf867ce10a6116b5b9120b38ee619d8aa172e424a0b8","observation_id":"4a9a7a8e-fa8e-465d-a7c3-0011f7212f13","resolution":{"observed_at":"2026-08-07T05:49:53.384201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.387583Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.387583Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:7f33741fd1ec44c1cae5a12bb62deebbbfd509cb07b6b2e74db14c5fce16e311","observation_id":"5c323aad-84cb-4215-9c20-e0af2b7a6b7e","resolution":{"observed_at":"2026-08-07T05:49:53.387583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T05:49:53.390941Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.390941Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:797c982f2aa4dde08842e57bcd3d1eb8d147322b04223fb71519d824f538ea25","observation_id":"f5324068-7c28-4598-a0ac-5e7f23433fe8","resolution":{"observed_at":"2026-08-07T05:49:53.390941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T05:49:53.393475Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.393475Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:c440977f92c8787f7e39066562843beb76b48ce1cd8395c82dbafa8dc72cc949","observation_id":"4714920f-c24b-4c1a-a7e2-0299bb14b562","resolution":{"observed_at":"2026-08-07T05:49:53.393475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T05:49:53.397026Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.397026Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:caf98fa1c1bec3281e3362971c19a6944f60b2cda799aa73cf0a6eef9948cb4d","observation_id":"20fd0780-27b5-4a90-872a-f5ccf4089a5d","resolution":{"observed_at":"2026-08-07T05:49:53.397026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-07T05:49:53.399967Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.399967Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:da65355c550e4c3d5ee935b6c8960c0567696e3fb21abee32f0225748b0a1422","observation_id":"78fa4c01-ccd7-4fb7-b01c-789b8ccbdd51","resolution":{"observed_at":"2026-08-07T05:49:53.399967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T05:49:53.403166Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.403166Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:2d0368e03d3e70e230ca5461f4e1ac55685f642286bac87e0ac82791dbf41cc6","observation_id":"3e0fbcc7-cc27-4663-a7cd-b84c9c0db2f4","resolution":{"observed_at":"2026-08-07T05:49:53.403166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-05T16:01:06.026395Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-07T05:49:53.405853Z","title":"World model on million-length video and language with ringattention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.405853Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:79368b215197ff542a84466279c5edfe3b8fabe869f9bcc5c7d4a1ff8f363926","observation_id":"01eb85a9-d3e8-4f7e-9a2d-ffdb046686dc","resolution":{"observed_at":"2026-08-07T05:49:53.405853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T05:49:53.408552Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.408552Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:d920340613ca04a15c11c69963864bdb6f9fa1c2780a7254dae20fcad2a3be3c","observation_id":"372c0c6c-ddb6-46d8-8879-8a2903415c3f","resolution":{"observed_at":"2026-08-07T05:49:53.408552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T05:49:53.411481Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.411481Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:bb33e15a1969fe0487140d6e8b4ceb4bb2ed42541a90f4b2780f8e2ebab4da5e","observation_id":"ea34d88d-cd06-4fee-838a-1704492c1e8c","resolution":{"observed_at":"2026-08-07T05:49:53.411481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.414273Z","title":"Longllava: Scaling multi-modal llms to 1000 images efficiently via hybrid architecture","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.414273Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:bb89c3bcfa7b2461563541d1c4aa448a70dfec2f449ff2d791526f6169e4aa5f","observation_id":"785eeebb-0c74-458b-91e0-3df35fdf5fc7","resolution":{"observed_at":"2026-08-07T05:49:53.414273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-07T05:49:53.416913Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.416913Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:46ca3ef6b87be7731b298d441b06370df71a62f9ac58dc54484796f69ceef3b7","observation_id":"dc8fecce-635a-4350-823e-a604ad8268a5","resolution":{"observed_at":"2026-08-07T05:49:53.416913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08085","last_updated":"2024-06-30T05:39:46Z","snapshot_observed_at":"2026-08-03T12:09:02.990658Z","submitted_at":"2024-06-12T11:07:55Z","title":"Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08085","snapshot_observed_at":"2026-08-07T05:49:53.419480Z","title":"Flash- vstream: Memory-based real-time understanding for long video streams.arXiv preprint arXiv:2406.08085, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.419480Z"},"links":{"cited_paper":"/paper/2406.08085","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:cd9250ada6b6c604c76d9d69d5242e44f05e6bb30696c950ec2bd72b0756d772","observation_id":"5c7ac51c-e03f-4c20-be75-737f1f5e4b4e","resolution":{"observed_at":"2026-08-07T05:49:53.419480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11481","last_updated":"2024-07-15T09:54:30Z","snapshot_observed_at":"2026-07-06T17:46:04.063798Z","submitted_at":"2024-03-18T05:07:59Z","title":"VideoAgent: A Memory-augmented Multimodal Agent for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11481","snapshot_observed_at":"2026-08-07T05:49:53.422447Z","title":"Videoagent: A memory- augmented multimodal agent for video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.422447Z"},"links":{"cited_paper":"/paper/2403.11481","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:0ba5e7c9562b7604224cd7a1b79f4ff07f7dcf5508e774279a5b155d35022e70","observation_id":"1eca1a7e-e2ae-4794-9fb8-a2cf4f1428ac","resolution":{"observed_at":"2026-08-07T05:49:53.422447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10517","last_updated":"2024-03-15T17:57:52Z","snapshot_observed_at":"2026-08-06T12:50:13.936842Z","submitted_at":"2024-03-15T17:57:52Z","title":"VideoAgent: Long-form Video Understanding with Large Language Model as Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10517","snapshot_observed_at":"2026-08-07T05:49:53.425309Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.425309Z"},"links":{"cited_paper":"/paper/2403.10517","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:eec69ef149e15819c783e0b1b4139eececbeb4d8e02594b979314de533c8238f","observation_id":"c0c07cc0-f991-4305-80a8-37b2a2c996c5","resolution":{"observed_at":"2026-08-07T05:49:53.425309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19209","last_updated":"2025-03-14T13:57:16Z","snapshot_observed_at":"2026-08-05T17:33:53.862042Z","submitted_at":"2024-05-29T15:49:09Z","title":"VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19209","snapshot_observed_at":"2026-08-07T05:49:53.428376Z","title":"Videotree: Adaptive tree-based video representation for llm reasoning on long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.428376Z"},"links":{"cited_paper":"/paper/2405.19209","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:8d3d8c78dbf86bac1eec7028c81e6c0fe3e996816b79d7ac21331230b04b2e79","observation_id":"28f45b09-2bf9-437a-841d-7b2e7489b3af","resolution":{"observed_at":"2026-08-07T05:49:53.428376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.431459Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.431459Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:f0b342b8af67461f351279cbab3e1a39911dae592fb5abc75893a40362d42cc2","observation_id":"307dc06e-81df-428d-b77f-398c091a9c6c","resolution":{"observed_at":"2026-08-07T05:49:53.431459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.434530Z","title":"Active retrieval augmented generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.434530Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:e1bd241ff9665956e92c03ed4d7782b34a8e2329323a15b159037efa6580d0f7","observation_id":"b84ea8fc-79e5-4af5-89b9-ee20d9c47a53","resolution":{"observed_at":"2026-08-07T05:49:53.434530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.437517Z","title":"Sentence-level prompts benefit composed image retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.437517Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:bec8234759d4b29af72e58780b1c44857d634f240d1c77c83ffc7c3b2be3f179","observation_id":"8afc8e91-0f1c-47c2-8a98-f9cd1ff1daed","resolution":{"observed_at":"2026-08-07T05:49:53.437517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12273","last_updated":"2023-12-19T15:56:08Z","snapshot_observed_at":"2026-07-06T17:05:22.992895Z","submitted_at":"2023-12-19T15:56:08Z","title":"VQA4CIR: Boosting Composed Image Retrieval with Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12273","snapshot_observed_at":"2026-08-07T05:49:53.440763Z","title":"Vqa4cir: Boosting composed image retrieval with visual question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.440763Z"},"links":{"cited_paper":"/paper/2312.12273","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:ee3865cdda6f8dd894dbf32bb07fa0f61696b2a5d1a3b0b314439163a7a358db","observation_id":"7e026fbc-b4f4-4fb3-806c-4d987713efd9","resolution":{"observed_at":"2026-08-07T05:49:53.440763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01219","last_updated":"2024-07-01T12:06:34Z","snapshot_observed_at":"2026-08-03T00:24:44.402950Z","submitted_at":"2024-07-01T12:06:34Z","title":"Searching for Best Practices in Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01219","snapshot_observed_at":"2026-08-07T05:49:53.443996Z","title":"Searching for best practices in retrieval-augmented generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.443996Z"},"links":{"cited_paper":"/paper/2407.01219","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:e3f15e4d15572dea03077cbf313211a25c515842c1ebc6440a922a30d842b966","observation_id":"fd6652c5-5c9d-4bb3-9842-a4c75f95a24c","resolution":{"observed_at":"2026-08-07T05:49:53.443996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13193","last_updated":"2026-05-19T15:04:52Z","snapshot_observed_at":"2026-07-06T18:48:16.629078Z","submitted_at":"2024-07-18T06:06:53Z","title":"Retrieval-Augmented Generation for Natural Language Processing: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13193","snapshot_observed_at":"2026-08-07T05:49:53.447621Z","title":"Retrieval-augmented generation for natural language processing: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.447621Z"},"links":{"cited_paper":"/paper/2407.13193","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:6d223cace802bc6ecf3b9b9f5f7d9258ae89b9f52c1f20045919e037b0d47bd4","observation_id":"211330bc-be32-4ab6-8105-170281393d0f","resolution":{"observed_at":"2026-08-07T05:49:53.447621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10981","last_updated":"2024-08-23T00:17:02Z","snapshot_observed_at":"2026-07-06T18:01:18.745347Z","submitted_at":"2024-04-17T01:27:42Z","title":"A Survey on Retrieval-Augmented Text Generation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10981","snapshot_observed_at":"2026-08-07T05:49:53.450836Z","title":"A survey on retrieval-augmented text generation for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.450836Z"},"links":{"cited_paper":"/paper/2404.10981","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:c055b21b8f7cb3bceffa52018395142c12fa9633ef718fd21c338c4f58e09c83","observation_id":"3de5b9a1-3313-48b8-a56f-8d2929889cf1","resolution":{"observed_at":"2026-08-07T05:49:53.450836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19473","last_updated":"2024-06-21T08:26:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:59:01Z","title":"Retrieval-Augmented Generation for AI-Generated Content: A Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19473","snapshot_observed_at":"2026-08-07T05:49:53.453946Z","title":"Retrieval-augmented generation for ai-generated content: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.453946Z"},"links":{"cited_paper":"/paper/2402.19473","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:018793ff7bc125f5fe373cc6bfd4e50d9ee8669b038ab168d02ae30195940280","observation_id":"cea28d7a-102d-4cb3-856a-122697f58eb1","resolution":{"observed_at":"2026-08-07T05:49:53.453946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11511","last_updated":"2023-10-17T18:18:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-17T18:18:32Z","title":"Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11511","snapshot_observed_at":"2026-08-07T05:49:53.457193Z","title":"Self-rag: Learning to retrieve, generate, and critique through self-reflection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.457193Z"},"links":{"cited_paper":"/paper/2310.11511","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:b4c9a295e32f7c3e4509b192ef12c4af3461e53f8668805c10dbf08f20686049","observation_id":"bf8931c0-9ddf-442f-9271-4b1c7f1279ff","resolution":{"observed_at":"2026-08-07T05:49:53.457193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.460122Z","title":"Realm: Retrieval- augmented language model pre-training","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.460122Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:902e7c3f8a4cc30666b5133f566fd241626ab013e0a7ca2cecb3f955d1e2a9d0","observation_id":"82e24110-d08c-4dbe-9695-4b2b63acb26f","resolution":{"observed_at":"2026-08-07T05:49:53.460122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15225","last_updated":"2023-06-25T17:56:37Z","snapshot_observed_at":"2026-07-06T15:32:35.999476Z","submitted_at":"2023-05-24T15:07:30Z","title":"SAIL: Search-Augmented Instruction Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15225","snapshot_observed_at":"2026-08-07T05:49:53.463160Z","title":"SAIL: Search-augmented instruction learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.463160Z"},"links":{"cited_paper":"/paper/2305.15225","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:51592a8ea4e691f566089ffe48a012d7acb95612154e996735f0da10616e9e7f","observation_id":"a1e3442f-a6d3-46a9-8103-6820d27ca7e6","resolution":{"observed_at":"2026-08-07T05:49:53.463160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.465906Z","title":"Dense passage retrieval for open-domain question answering","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.465906Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:e245c8c8546d1ea162ba2473ffc48ede781be5147f85be8ac6cb5cb4e65cf914","observation_id":"f6995908-3bb9-49a2-8ee2-fe0fc8b4e038","resolution":{"observed_at":"2026-08-07T05:49:53.465906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.469041Z","title":"Document haystacks: Vision-language reasoning over piles of 1000+ documents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.469041Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:452bf9eb32e305f86d0e02494d990a743ad2b85fa6274f74a82c8cbd8a98710a","observation_id":"9d1c0ee8-f18d-4add-88fc-4f40f10f5aea","resolution":{"observed_at":"2026-08-07T05:49:53.469041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.472251Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.472251Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:1428bfaad1017a198ae0d82a9c6c08c04321bb94a0448b963a5dd0db4c57dc25","observation_id":"ecef7520-2cff-45d5-9b6d-d3d4fb5e731a","resolution":{"observed_at":"2026-08-07T05:49:53.472251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13766","last_updated":"2025-03-11T17:31:27Z","snapshot_observed_at":"2026-08-03T10:33:33.362949Z","submitted_at":"2024-07-18T17:59:30Z","title":"Visual Haystacks: A Vision-Centric Needle-In-A-Haystack Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13766","snapshot_observed_at":"2026-08-07T05:49:53.475228Z","title":"Gonzalez, Trevor Darrell, and David M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.475228Z"},"links":{"cited_paper":"/paper/2407.13766","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:e350344423a6128029dcd2cc5a615fa982680f2d678114894384dcbdea6cd8ab","observation_id":"03f03589-0a7e-44de-a1b4-023e511b63e0","resolution":{"observed_at":"2026-08-07T05:49:53.475228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10594","last_updated":"2025-03-02T01:19:51Z","snapshot_observed_at":"2026-08-02T13:24:00.339129Z","submitted_at":"2024-10-14T15:04:18Z","title":"VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10594","snapshot_observed_at":"2026-08-07T05:49:53.478155Z","title":"Visrag: Vision-based retrieval-augmented generation on multi-modality documents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.478155Z"},"links":{"cited_paper":"/paper/2410.10594","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:309d0b55e1611fe3d6149b6eea847413697506c853387b85217f74c69ae2254f","observation_id":"b601c34f-c801-408f-b65c-b77ebb3da369","resolution":{"observed_at":"2026-08-07T05:49:53.478155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16636","last_updated":"2025-08-15T09:45:15Z","snapshot_observed_at":"2026-08-07T17:55:00.749664Z","submitted_at":"2025-02-23T16:23:50Z","title":"Visual-RAG: Benchmarking Text-to-Image Retrieval Augmented Generation for Visual Knowledge Intensive Queries","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16636","snapshot_observed_at":"2026-08-07T05:49:53.481450Z","title":"Visual-rag: Benchmarking text-to-image retrieval augmented generation for visual knowledge intensive queries","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.481450Z"},"links":{"cited_paper":"/paper/2502.16636","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:51eb664998c7d0ef4ddbe2006b12112bb6a6ef454ef38350218cd6383b0afa11","observation_id":"326e72fd-02cb-4c9e-924a-f48db5577fca","resolution":{"observed_at":"2026-08-07T05:49:53.481450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.484538Z","title":"Vdocrag: Retrieval-augmented generation over visually-rich documents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.484538Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:f7645fba740e884d5e4b00ca625a2eb4d074d01498f9819dc71099c0ec8b8e8f","observation_id":"ffd5fd2a-22ec-48b0-bdf5-303b0fafa39b","resolution":{"observed_at":"2026-08-07T05:49:53.484538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03809","last_updated":"2022-10-29T10:08:13Z","snapshot_observed_at":"2026-08-05T15:50:39.183704Z","submitted_at":"2022-10-07T20:35:58Z","title":"Retrieval Augmented Visual Question Answering with Outside Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03809","snapshot_observed_at":"2026-08-07T05:49:53.487275Z","title":"Retrieval augmented visual question answering with outside knowledge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.487275Z"},"links":{"cited_paper":"/paper/2210.03809","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:39256400420e0e1738d1d87d011bc6cafe3d10c816a1fb91239d1a1458a37172","observation_id":"cc435739-a5a2-4dbf-bfbf-127ac913f76d","resolution":{"observed_at":"2026-08-07T05:49:53.487275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15268","last_updated":"2025-02-06T05:51:07Z","snapshot_observed_at":"2026-07-06T18:49:46.992782Z","submitted_at":"2024-07-21T21:04:28Z","title":"Fact-Aware Multimodal Retrieval Augmentation for Accurate Medical Radiology Report Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15268","snapshot_observed_at":"2026-08-07T05:49:53.490369Z","title":"Fact-aware multimodal retrieval augmentation for accurate medical radiology report generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.490369Z"},"links":{"cited_paper":"/paper/2407.15268","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:da1880940d9e1bc42d63a75f8079224906bb3167b143eb2180d5606480087116","observation_id":"13bf5ae5-ae74-47dc-b20a-7252476bba83","resolution":{"observed_at":"2026-08-07T05:49:53.490369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.493573Z","title":"Rule: Reliable multimodal rag for factuality in medical vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.493573Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:bc79187e2c5d6bdaed49e02b452b8d9fcb9deab9942fb18e44a2df9f02bf08ec","observation_id":"3a3c1727-6ef2-48e4-88fb-1affe423f913","resolution":{"observed_at":"2026-08-07T05:49:53.493573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T05:49:53.496853Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.496853Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:734486683b337d0fcf71b064d416d8382c8afd9d9bfe6d1dee4dc813797ef91f","observation_id":"fe7e62fc-4e71-4d67-8fa1-ece2db426d5e","resolution":{"observed_at":"2026-08-07T05:49:53.496853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.499783Z","title":"Gpt-4o: Enhanced multimodal language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.499783Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:5ca8b2bcd43d97206cb4828858344515b551957ce17948aba7115b6325bc3b18","observation_id":"27713dc0-bfae-43f4-8ab4-52514fc9136e","resolution":{"observed_at":"2026-08-07T05:49:53.499783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.502745Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.502745Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:1686792469ed091a3facc8bb37c1b040f49aa13e3f061bdc48e822f140cbdf43","observation_id":"740f4cb2-fa07-4a92-9683-d5d6d5972ec0","resolution":{"observed_at":"2026-08-07T05:49:53.502745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-07T05:49:53.505625Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.505625Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:5479bfc9539054e900cea6210d7e97308032f2a1e953fd0ae36e1d08e9589742","observation_id":"8129eeaa-5041-402e-90f5-2c55f99f7835","resolution":{"observed_at":"2026-08-07T05:49:53.505625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-07T05:49:53.509123Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.509123Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:3e2875d7a4ba453747ed5c4c589c1cae9ea1f49287df76e88dcfcf87f6c4706a","observation_id":"e9e009aa-e610-432d-a75e-7b9b36171587","resolution":{"observed_at":"2026-08-07T05:49:53.509123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.511845Z","title":"Making the V in VQA matter: Elevating the role of image understanding in Visual Question Answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.511845Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:ca335586cdd72fe4d9ef664293d82a2b28b891771123778d10503d278eedcd91","observation_id":"f397db9d-cebe-4215-ac62-ec113453365f","resolution":{"observed_at":"2026-08-07T05:49:53.511845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-04T04:40:00.850270Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-08-07T05:49:53.514613Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? arXiv preprint arXiv:2403.14624, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.514613Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:74cc48aa2ef299e2735803766c3fcf62297eb774cc48244ea710ac64d4fbdd02","observation_id":"fd642cb6-bd08-4575-a76d-a41451365bf0","resolution":{"observed_at":"2026-08-07T05:49:53.514613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T05:49:53.517861Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.517861Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:11a1ed186aa2b292d704703e5d96cb1f8845115ca87e82adcb33b08e176db32c","observation_id":"10e2c647-8096-410e-bede-17e3d463131c","resolution":{"observed_at":"2026-08-07T05:49:53.517861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01549","last_updated":"2025-02-03T17:30:19Z","snapshot_observed_at":"2026-08-07T22:11:52.617814Z","submitted_at":"2025-02-03T17:30:19Z","title":"VideoRAG: Retrieval-Augmented Generation with Extreme Long-Context Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01549","snapshot_observed_at":"2026-08-07T05:49:53.521074Z","title":"Videorag: Retrieval- augmented generation with extreme long-context videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.521074Z"},"links":{"cited_paper":"/paper/2502.01549","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:4352c42dced312f96de3a5fdbeec95b6260e54cecf81aa3f0795223bc11a0e24","observation_id":"8712754c-c291-4b51-9ca2-36203477e74a","resolution":{"observed_at":"2026-08-07T05:49:53.521074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.523879Z","title":"V-desirr: Very fast deep embedded single image reflection removal","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.523879Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:a9985a31e9efe3f5fdff9a7ec80e18ed1699a1101002463cced2c26c3e8987aa","observation_id":"94a4611f-a6a2-4342-a19f-f5cbfc809bc6","resolution":{"observed_at":"2026-08-07T05:49:53.523879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.526839Z","title":"Measured albedo in the wild: Filling the gap in intrinsics evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.526839Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:7e585620fd329ad47dd1494f80e8f0d3546dc6957c79b4a2ac7c3ab7f053801a","observation_id":"cb64ee82-bb51-4f1b-a730-c2ccfc1ca690","resolution":{"observed_at":"2026-08-07T05:49:53.526839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.530209Z","title":"Adverb: Visually guided audio dereverberation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.530209Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:c9028e6f1ff8009eb2707a1c3073b2057968dd214ef328697f4d37d0c36ad9fb","observation_id":"ccf0e7a5-89b1-422e-b981-79f3699f5364","resolution":{"observed_at":"2026-08-07T05:49:53.530209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.533720Z","title":"Melfusion: Synthesizing music from image and language cues using diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.533720Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:d41b2a8cc8d1af77f3917611ced5bbe9c12e2664a56b1929bbb5de14e14bb98a","observation_id":"24a613e3-e1f0-43fe-89fb-6bf65e1a63a2","resolution":{"observed_at":"2026-08-07T05:49:53.533720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.536648Z","title":"Foleygen: Visually-guided audio generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.536648Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:e7b575bce7823076beb90cc736ad58a273b3273286fad5a6690468d24203539e","observation_id":"ece97e52-8192-434d-8c9a-7279ccfaf2c2","resolution":{"observed_at":"2026-08-07T05:49:53.536648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.539318Z","title":"Codi-2: In-context interleaved and interactive any-to-any generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.539318Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:281613229f5674fa30147f69c44204674d4b51d5290fb686c31ebb49a6579228","observation_id":"e61e0399-ea2b-4839-8675-591d47f90ef7","resolution":{"observed_at":"2026-08-07T05:49:53.539318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:54.390385Z","title":"Listen to the pixels","venue":null,"work_id":"60a6f391-2407-4a32-9204-2a6546cb5cca","year":2021},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.542548Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:80561a00740992d7e640cba0bead300c1290bcc57fb25e865d043c468a21a748","observation_id":"95e292b2-e55e-489f-8221-178eeb0a9785","resolution":{"observed_at":"2026-08-07T05:49:54.393061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:54.381661Z","title":"Audvisum: Self- supervised deep reinforcement learning for diverse audio-visual summary generation","venue":null,"work_id":"1cbb63c1-fe7e-49e7-9d5c-47a50537e962","year":2021},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.545730Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:e5aa20533e2010669ef984c1b80f5fae2e8df3a50fcde8a3c80a12f8f09effba","observation_id":"8df9726a-60c8-4102-83a5-372640adcbd6","resolution":{"observed_at":"2026-08-07T05:49:54.385050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":96,"verified_exact":2,"verified_fuzzy":2},"total_outbound_references":127},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 127 outbound references and 3 inbound Pith citation observations for arXiv:2506.07016."}