{"as_of":"2026-08-20T08:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6147953255afaf8895d360ce2db15f7a571b621977c2ed131656b676821c4d14","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T13:59:01.287449Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.02091/citation-record","integrity":"/paper/2604.02091/integrity","json":"/paper/2604.02091/citation-record.json","paper":"/paper/2604.02091"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:c99ec8082d10e89cc839ab704a6f559f7533db4485125f1b89b94f7e056cd644","observation_id":"e319dbd0-c789-41db-bc1c-27ef7513cfc1","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:9ea10d285e8228af91f7cb605d2b397f8685d70ff4efae47968f82dc10bebe91","observation_id":"d64b3c60-9a7d-49f3-ae14-76661596701f","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02642","last_updated":"2025-02-28T19:49:30Z","snapshot_observed_at":"2026-08-20T07:38:31.569998Z","submitted_at":"2024-10-03T16:25:37Z","title":"Attention in Large Language Models Yields Efficient Zero-Shot Re-Rankers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02642","snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"cited_paper":"/paper/2410.02642","citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:40401e65079c8936be3677a3dd1a11eef4cf5800dcf2d1109ac87c1f9e5d1223","observation_id":"91744e54-eac7-42f6-9732-e298f256bb8f","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:1c4dd59ff79ba6c291780d18c598fc0bbbd50eda2aa3d66c447c8e3f32712515","observation_id":"b8db992d-2cfa-45c7-a029-a14ef9c750f6","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:30f6a265b283fa0afd004d6d1bde62b6d81516161eba92098b4f5af9d8da9f2c","observation_id":"db6996dc-f1c9-4f85-91ba-6b71ff16808e","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:9e25db1cedebe3ceb4f90384eaeb09ca830759bd265692492c4fa6fcd27b2658","observation_id":"a2181c2b-5f0b-4fdb-b041-619478788764","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:9d0fd4406aba1ee8b01896f74370e6f2b563347212724a25e787979cc5e81b17","observation_id":"5d32d157-23e2-4cac-9cd5-e7149cc2f6b1","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01142","last_updated":"2025-06-08T17:17:01Z","snapshot_observed_at":"2026-08-17T18:57:06.944106Z","submitted_at":"2025-02-03T08:22:45Z","title":"DeepRAG: Thinking to Retrieve Step by Step for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01142","snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"cited_paper":"/paper/2502.01142","citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:44e7518dddbe40d3ca35ef74bcbb40c4ae5725e3641b8aed7c1b10459606c9b0","observation_id":"9aaa5580-a00e-4da4-9507-541ad90ce0bc","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:391eb1efa39fd8b6f802f773668dca9bc1183821a92f0927a65a0e77671c49ac","observation_id":"2631c07a-d806-4ac4-a165-0921c27eab26","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-08-14T05:50:17.249446Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:f3a85ac4fb79ec2b2a17b7804f203fa821941cfea316f77394a45fdb0214e55c","observation_id":"8fc202cb-85db-4836-96c9-7cbe4707b7b6","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.01282","last_updated":"2021-02-03T09:18:34Z","snapshot_observed_at":"2026-08-18T00:05:48.019000Z","submitted_at":"2020-07-02T17:44:57Z","title":"Leveraging Passage Retrieval with Generative Models for Open Domain Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.01282","snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"cited_paper":"/paper/2007.01282","citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:ed25e587243df7681e93353fddf10b1fa75c86b42ba4d94705bbbb653bb6fe28","observation_id":"2dd75243-53c7-4e5b-b69b-6975849bc3b5","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:a5ef9ae3c9ae4de3cceece76614e9ca474404d70f63d2d497b1af0ddc76f0d76","observation_id":"ffb2735e-d440-47bf-b948-c8d9734e8cd0","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14403","last_updated":"2024-03-28T06:45:11Z","snapshot_observed_at":"2026-08-20T07:16:45.619080Z","submitted_at":"2024-03-21T13:52:30Z","title":"Adaptive-RAG: Learning to Adapt Retrieval-Augmented Large Language Models through Question Complexity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14403","snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"cited_paper":"/paper/2403.14403","citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:601003ded41a3f503f1453ec063405d7090398761215650e03f9db9ebf760e2e","observation_id":"66bf8b90-d21b-4c01-96a1-555573eadf98","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:65349241553d92d8b7e94467c0638170b1c1061674712c1f07539a869f004b2d","observation_id":"57fb572e-0ade-40f1-816e-2b929b1b04d1","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:f629075a0b50e332cda6682f9577a5860d0c04d896d8d87fa8caa6a5e66b3b75","observation_id":"521d7dc9-1e27-43e7-9b4e-769c3123052e","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:a36f71d220733a4fc020d69695be6132fa8e14eb440e8af4a1835dd7faf1020b","observation_id":"f2bf93c0-5b4f-4fb6-a5ab-ed82c5e3b010","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:531f7df634aceb24d5efced7752cc059ef7ff9c7245531c440ad80564f854e51","observation_id":"8e44e9ec-47e5-49ce-a5be-7cbe6e32a579","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:d5f667d4b3763a75427a3bc101727c38d8ead2917b4fb4347e84960f0d95c0bd","observation_id":"f16c8cb4-a615-4083-a195-b28e8a44f26d","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:7a44c35b6fc018319a7d21f0789e91894db3777da637cf64620655398275d218","observation_id":"b1e5531d-bd7e-4d62-94ec-5dc2274fa37f","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.acl-long.861","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"13d7df27-80d2-4515-a428-f0a08fb0152b","year":2025},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:3eba71157884c077237b32882a0baec7b5abad9af1ead81051faaebb4ac16586","observation_id":"3259635c-63d2-4752-a955-e0eda334a52f","resolution":{"observed_at":"2026-07-13T13:59:38.986618Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":"u ttler, Mike Lewis, Wen-tau Yih, Tim Rockt\\","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:6db974ce617fc970dd980730af8ba39723c053c76116bc73296a606eed3cce54","observation_id":"98d2654a-bef3-4f9b-8e0b-6b9a6bb4e4c9","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:15e1aea34a9395d25c4ba685ec57fab547da2c6b942d2a1feb6257493699440e","observation_id":"ebb46ea2-80a8-420e-84cd-430ba0764a6c","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:6df8bae775442c94c09e073ecded0044465489581d9cdee53262c575ac59db85","observation_id":"e371d8d8-0baa-409c-b2a1-d63aa8fb4861","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:60e53de96c4753f31903bae03816dfa1c18a7870bcb49337cc1190f1446e3fe8","observation_id":"38e2699b-0ae9-4ccd-aa75-7094988120bc","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:13301e2459919cf39da420b0be04109cfa5309d2189600600313e601329f72dd","observation_id":"531003a4-cd1b-4e7e-b626-afd8c859b197","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.10645","last_updated":"2020-10-05T03:28:21Z","snapshot_observed_at":"2026-08-10T00:47:33.544216Z","submitted_at":"2020-04-22T15:42:13Z","title":"AmbigQA: Answering Ambiguous Open-domain Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.10645","snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"cited_paper":"/paper/2004.10645","citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:0e20ee829c561b41ed9215a79a51308379b5ef618582dc0b94c0e46139a13af3","observation_id":"b0284e23-730a-41ba-b72c-ad9ed24d3480","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:dc409087c04216111f3819485b5247859a07aafe3a73b0f7a9a7f0db39fb7c02","observation_id":"5405dbae-be00-47ae-8d3f-70f46d10a6bb","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-19T02:54:55.334346Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:6702d683107208cee4002afb26797df40521892654aff2e2900a438b65c7b8c2","observation_id":"cdc17a1c-5daa-4bfc-9034-c5d2ced7933a","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.04085","last_updated":"2020-04-14T14:57:40Z","snapshot_observed_at":"2026-08-12T23:25:05.204139Z","submitted_at":"2019-01-13T23:27:58Z","title":"Passage Re-ranking with BERT","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.04085","snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"cited_paper":"/paper/1901.04085","citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:f3c854b06e6a4de6d3ed9b024b3da8346debd91d08ad1fa8c3b47296cc06c428","observation_id":"ac505bf9-f590-4b74-bf48-8f4cc96274ec","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.14424","last_updated":"2019-10-31T12:45:40Z","snapshot_observed_at":"2026-08-19T05:41:17.678203Z","submitted_at":"2019-10-31T12:45:40Z","title":"Multi-Stage Document Ranking with BERT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.14424","snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"cited_paper":"/paper/1910.14424","citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:12b19da6d64da43eb8c48367bbbe4a7bbcd7d67b994ea8f8286c008217dbf31d","observation_id":"d073a16f-e56f-4ac4-9403-90d940f5c569","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:50491803e066aebc7ba27b6d31b20537f9b12e2d7a25bbd20f8a0b0ea7ed15f2","observation_id":"d0a56791-c706-46fb-9e00-47c56d7b762a","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02724","last_updated":"2023-12-05T12:39:00Z","snapshot_observed_at":"2026-08-11T22:23:22.715360Z","submitted_at":"2023-12-05T12:39:00Z","title":"RankZephyr: Effective and Robust Zero-Shot Listwise Reranking is a Breeze!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02724","snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"cited_paper":"/paper/2312.02724","citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:581cd08666af0824308757d60b3a41426d6a0a74e94f6e6fe13dfb472f2f5889","observation_id":"bfc6cbe7-d292-40c1-b696-2169ba8a52e1","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:c8d1127825751d87930aaeafe1966af0ef98c8ca8cf468f7ef290db5ca25bd8f","observation_id":"02c0f16a-ee4a-4503-8588-f657852e92d7","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15657","last_updated":"2024-06-21T21:27:50Z","snapshot_observed_at":"2026-08-20T07:36:13.142090Z","submitted_at":"2024-06-21T21:27:50Z","title":"FIRST: Faster Improved Listwise Reranking with Single Token Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15657","snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"cited_paper":"/paper/2406.15657","citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:07c034b3e782b9c6cba32d762e69467621444451a56c777fadd14cefe4781bc5","observation_id":"5f7e9cc9-11f8-4523-99e4-1e16235a9300","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:036cdad71d4362cda1e9eed5e31b4ad594e6aa814c07d043772deca193293009","observation_id":"a4d113d1-f455-44fa-9f62-b9ee1c9951e2","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-15T05:06:05.489107Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:dfb0cab7495689ad7f2fa0495c5af8edd58d69db8bb42166a445bd2634b22aa8","observation_id":"7c898c14-49db-4b9f-a007-3f6ebbba6adf","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:7f3274a763d41a46e3efe1886ed5b723946260c3bf5bc078ad55e0913940b56d","observation_id":"830f22c7-3991-4bf5-b515-0992798518c1","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.07567","last_updated":"2021-04-15T16:24:43Z","snapshot_observed_at":"2026-08-18T13:14:17.879046Z","submitted_at":"2021-04-15T16:24:43Z","title":"Retrieval Augmentation Reduces Hallucination in Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.07567","snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"cited_paper":"/paper/2104.07567","citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:069d5dff78a10a4a75141b6721e83f27a5399420bb8de89fedae91e25c7cc4a5","observation_id":"ea2c8636-a071-4899-90b7-3e6e9d9c83b1","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:c7705d2eb249dfd12bb47ff1cbc2858e0ae344019882add03307c6a81af3f32c","observation_id":"0e646110-e67d-49df-b641-55a4bea42bd9","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07233","last_updated":"2025-05-16T02:47:07Z","snapshot_observed_at":"2026-08-16T04:58:49.551537Z","submitted_at":"2025-05-12T05:19:01Z","title":"DynamicRAG: Leveraging Outputs of Large Language Model as Feedback for Dynamic Reranking in Retrieval-Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07233","snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"cited_paper":"/paper/2505.07233","citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:ec1072555433637fa02934ae270c52c839d57830c8e8cba219f098d33cf84409","observation_id":"c5c6cba6-58a2-4529-a767-ee34a853a36c","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09542","last_updated":"2024-12-28T06:20:54Z","snapshot_observed_at":"2026-08-19T18:37:55.435679Z","submitted_at":"2023-04-19T10:16:03Z","title":"Is ChatGPT Good at Search? Investigating Large Language Models as Re-Ranking Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09542","snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"cited_paper":"/paper/2304.09542","citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:101450022cb15c3f9b68a835d0aa8eb28ec675577be0b67185e4ea88be592d7f","observation_id":"d80fef6f-11d2-40af-894b-de80f63b820d","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:56aa494c80fd4ac02c2c269c16115282b168db8ad3bd0f06b7f1f4a4b2824e2f","observation_id":"6f6c0135-5b84-4663-8c3f-8bd3a42d0358","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10509","last_updated":"2023-06-23T00:59:13Z","snapshot_observed_at":"2026-08-15T17:29:02.957931Z","submitted_at":"2022-12-20T18:26:34Z","title":"Interleaving Retrieval with Chain-of-Thought Reasoning for Knowledge-Intensive Multi-Step Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10509","snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"cited_paper":"/paper/2212.10509","citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:b85ca96379198d87a42581a59b48885c7a8d32b1394cb504081b0c2fefa07e39","observation_id":"4875af82-6871-46ed-b30f-54e2222d9230","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:d5fc565b614e8f6de1fdc03658cf55c69675e9294bb753a586061f8644f77c97","observation_id":"778fc0f8-4e93-4bec-ade4-4b16e201a1d8","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:c52e1ee3a7739fd52db4e20932a7060289c07fe5f33554c4ce10d773549fb05b","observation_id":"5323cb47-3a6a-45ac-89b6-538237a64e13","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16427","last_updated":"2023-12-07T14:39:22Z","snapshot_observed_at":"2026-08-16T14:49:04.557806Z","submitted_at":"2023-10-25T07:47:01Z","title":"PromptAgent: Strategic Planning with Language Models Enables Expert-level Prompt Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16427","snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"cited_paper":"/paper/2310.16427","citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:920b2bd7588d84b4f2f320785e00827694925d7e4a2b7c85d4eee449383cc0b0","observation_id":"75fd3e11-57cf-4541-b5d2-b577384457e7","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07597","last_updated":"2024-09-24T03:01:25Z","snapshot_observed_at":"2026-08-18T00:19:33.067213Z","submitted_at":"2023-09-14T10:57:50Z","title":"C-Pack: Packed Resources For General Chinese Embeddings","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07597","snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"cited_paper":"/paper/2309.07597","citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:8b1583912469027209c30eada565cf27f8876c6722b9768904b32a402edc6069","observation_id":"c4954a0d-e10d-4e80-8280-6129688e4989","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:4ecae0743f4138abd4b90150e3c7cc20663d25eff11c66f0afbbd974ebfa75ca","observation_id":"5475d41e-0df9-47d3-b6e8-2ba75bcf861b","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-08-17T01:54:11.006899Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:756139a4d6b9d1c70c9ef170fab3bd9c73a794b3220639a43ad1beb7d3da20dd","observation_id":"f7776387-9543-4468-a19e-5fa2955252a2","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:81d4b117fd223f8f3a7761909007392c4e7ef38d31011dec162a7effbca4c882","observation_id":"4db4453b-27ea-4b04-b281-ffbc8d386f01","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:7b5a058f1e51bb69fb8f5290d9c54e35d03adb479d610ac259ffc8628626a0de","observation_id":"f89c5535-6543-42aa-be52-24ed84fa887e","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:c85e7fd7d540521d85bd1523aa20b1bded2f3113fd6da06a484631b4aab125b9","observation_id":"dd0f40a5-8536-44cf-a258-89ff43212f08","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20046","last_updated":"2025-05-26T14:31:48Z","snapshot_observed_at":"2026-08-18T03:01:29.832510Z","submitted_at":"2025-05-26T14:31:48Z","title":"REARANK: Reasoning Re-ranking Agent via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20046","snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"cited_paper":"/paper/2505.20046","citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:163790d3412e4e12cc849430dc0a5b633b573725e0c951761b5463c541e2162b","observation_id":"9e5b552c-b100-400b-a8f4-79f2f8db55a4","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v39i24.34783","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"9f3b7415-7fa1-4e3b-b33c-b78537a3497e","year":2025},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:b92c0cbf8fada8f3a419e5bac48b52288e00ae5f6d4733eb518bf42c3046659e","observation_id":"86ab9ee2-68d9-4402-a0e9-ca2c83ba7f37","resolution":{"observed_at":"2026-07-13T13:59:38.992267Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:4b21a0f258d35a5078443a86edd008a7ea33f981723542e48fca8c2b8e282c14","observation_id":"0e94330a-cf02-47e1-baa5-9192a790102e","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05176","last_updated":"2025-06-11T02:54:49Z","snapshot_observed_at":"2026-08-20T02:29:37.867282Z","submitted_at":"2025-06-05T15:49:48Z","title":"Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05176","snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"cited_paper":"/paper/2506.05176","citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:69d15e00dc20746915e9a0563586fb09cbcf0fb50a951e3c66f489b222e577e1","observation_id":"8c5d59e8-6cc1-41d4-8909-9c5cacc56aa0","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06532","last_updated":"2024-05-28T13:58:32Z","snapshot_observed_at":"2026-08-16T14:27:58.216618Z","submitted_at":"2024-01-12T12:10:28Z","title":"INTERS: Unlocking the Power of Large Language Models in Search with Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06532","snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"cited_paper":"/paper/2401.06532","citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:cad3dc7a233f29af724134e617a6ddb9ecb20bb92b56fbc884746fabfbc2abe0","observation_id":"954e8775-b5a0-49a2-ae9d-60be74f45334","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T02:13:40.465768Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2604.02091."}