{"as_of":"2026-08-09T11:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:20ce52d0d25b25f9bda08943f0951c8fa006da202f3128b912bd346d185d3522","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T03:01:25.036117Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.25268/citation-record","integrity":"/paper/2607.25268/integrity","json":"/paper/2607.25268/citation-record.json","paper":"/paper/2607.25268"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-01T03:01:16.581982Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:16.581982Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:108eb690800ce18ad42abc5f02bc30a643eb5fd4e3cafe9797608c8612fc9c40","observation_id":"7caedda0-3cfc-430c-8ce5-4993a0ac57fa","resolution":{"observed_at":"2026-08-01T03:01:16.581982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:16.676601Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:16.676601Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:250ca92fd885f07914edb2ead4e34cfffd16c27a7656553b29e116e6169b9f61","observation_id":"dfea07c9-146e-4163-83cb-110c5bf6c353","resolution":{"observed_at":"2026-08-01T03:01:16.676601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:16.841107Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:16.841107Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:071842f54c033f338015deca8dd8da58e497f6830437b182213472b86d052b92","observation_id":"9e986f31-6309-44d5-9489-88b6c2927b50","resolution":{"observed_at":"2026-08-01T03:01:16.841107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:16.928116Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:16.928116Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:d0ad4a7ba531ffa11f91f680a219e722e1a08be9dbda2b54f89dae6adcd8b351","observation_id":"7115f799-f9b3-47c6-8a2b-8e9863a016be","resolution":{"observed_at":"2026-08-01T03:01:16.928116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:17.040318Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:17.040318Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:ffd88abe6267bb6573c78532766ed506265b2251e9da898c4a1b141a7036529c","observation_id":"8846f087-c10b-4c47-9ab2-1ec82ff3cda1","resolution":{"observed_at":"2026-08-01T03:01:17.040318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:17.159464Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:17.159464Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:7f66be8a5dbfba8ca700e23ee7e1f2c4b8f8a6f5b27cd63a52311769de78a7f2","observation_id":"67f8ca40-6e17-48b6-b968-5618d046ff55","resolution":{"observed_at":"2026-08-01T03:01:17.159464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:17.249679Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:17.249679Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:baf64cbb2fffd27df279781f04ecd3a10e31237f383a9361eb71da3a565a6190","observation_id":"07e2a0ec-def8-413e-b10b-8c900533d5ae","resolution":{"observed_at":"2026-08-01T03:01:17.249679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:17.315151Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:17.315151Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:b59fd067a75c6f7c9696981a9e26f65f3f2896f3499ee31634a6e09b4c6e35e7","observation_id":"ae509106-963c-420a-b1c5-d11736d16107","resolution":{"observed_at":"2026-08-01T03:01:17.315151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:17.399402Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:17.399402Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:b78390ef2de0fddf9d208e900ca5ec71e1ef8749f1e2483209c53a4c46fd696f","observation_id":"e0adccbb-4dbb-4da1-ac30-e8d7a6d1b462","resolution":{"observed_at":"2026-08-01T03:01:17.399402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:17.543581Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:17.543581Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:b99e3f944ac8b2ed1dc99c2ee921b7490dd5788acf8153a559594e760c4c85b0","observation_id":"135fac80-d037-4171-ab7c-bf70dd007127","resolution":{"observed_at":"2026-08-01T03:01:17.543581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03216","last_updated":"2025-12-12T11:26:32Z","snapshot_observed_at":"2026-07-06T17:25:35.493362Z","submitted_at":"2024-02-05T17:26:49Z","title":"M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03216","snapshot_observed_at":"2026-08-01T03:01:17.700594Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:17.700594Z"},"links":{"cited_paper":"/paper/2402.03216","citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:3cb0e1e0385774bf662c4ae8548f46485facd3f80b9871717b68fada614049d6","observation_id":"684e3b68-8fae-4d3a-8fbd-67313196dc2a","resolution":{"observed_at":"2026-08-01T03:01:17.700594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:17.753102Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:17.753102Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:e687a63c52057dc42b052326bb20267cf712c15421f2254838a87fe0ab3e4631","observation_id":"9f4ef741-0937-43ae-9ff7-3894acbe5224","resolution":{"observed_at":"2026-08-01T03:01:17.753102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:17.828065Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:17.828065Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:abad5e20eb1d78b55bf6f5e131b3901d5e40ba4745b65381bd043d5ef3701737","observation_id":"6b00b30e-4146-4b41-beeb-bfeb30b8e0bd","resolution":{"observed_at":"2026-08-01T03:01:17.828065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10865","last_updated":"2025-07-10T20:48:22Z","snapshot_observed_at":"2026-08-06T18:23:12.659099Z","submitted_at":"2025-07-10T20:48:22Z","title":"Overview of the TREC 2022 deep learning track","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.10865","snapshot_observed_at":"2026-08-01T03:01:17.900051Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:17.900051Z"},"links":{"cited_paper":"/paper/2507.10865","citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:fc4cd4298dd237a8f178453dc847a41eddc46c83c5efe010eaa453f48a388610","observation_id":"97c22a28-6038-4cf0-8049-7f1509929012","resolution":{"observed_at":"2026-08-01T03:01:17.900051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:17.993822Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:17.993822Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:34c4f64f6c8011b3ba0a5116fe8a35bbb1acc85cbdbdb9b0a636a0522f3b13d6","observation_id":"99beff27-dc32-4f82-833b-e4dbe18b0733","resolution":{"observed_at":"2026-08-01T03:01:17.993822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:18.157053Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:18.157053Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:c79bb875ff0dfdae991c9eb8f18581af2e31a9d81b1d7014edb78d24655c911b","observation_id":"632f8fd0-6e4e-43aa-992f-6e65d717e1af","resolution":{"observed_at":"2026-08-01T03:01:18.157053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:18.235946Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:18.235946Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:25ae7e498629511fade2b96e1224726fc1934e662d2ba08a84b63e51e5b17404","observation_id":"9538c0c2-a2ec-4e83-b7d0-e8223469f1ea","resolution":{"observed_at":"2026-08-01T03:01:18.235946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:18.317869Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:18.317869Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:77baad75a39ebed3db350dec842db50e980d0ab574270cb2484f4fcbeddb2f4e","observation_id":"36e1678f-fbc1-4278-a23c-9227bb00f944","resolution":{"observed_at":"2026-08-01T03:01:18.317869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:18.505200Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:18.505200Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:66a72ba85d96cf0a85d9b935418dae4ee9bac733672139c8bb9a6b984824e240","observation_id":"8c0bc7b6-fec5-42c2-9174-960868d93029","resolution":{"observed_at":"2026-08-01T03:01:18.505200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.02247","last_updated":"2017-02-27T21:48:25Z","snapshot_observed_at":"2026-08-06T00:36:11.893692Z","submitted_at":"2016-11-07T20:09:16Z","title":"Q-Prop: Sample-Efficient Policy Gradient with An Off-Policy Critic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.02247","snapshot_observed_at":"2026-08-01T03:01:18.570841Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:18.570841Z"},"links":{"cited_paper":"/paper/1611.02247","citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:e13183bc02414e0ef0379d485a1b03484c6eb1ee5a191ddbce2254857d3c3723","observation_id":"f175c101-4fe5-4ec7-b7a4-1671bb858411","resolution":{"observed_at":"2026-08-01T03:01:18.570841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:18.621575Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:18.621575Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:54470933ca16e7b4dc43023e00cc3c83ad16d0c80d179292c484757de67b1528","observation_id":"955d6b24-15f7-48cd-a0ff-4d0aa4e6b380","resolution":{"observed_at":"2026-08-01T03:01:18.621575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:18.717296Z","title":"1954.Statistical theory of extreme values and some practical applications: a series of lectures","venue":null,"work_id":null,"year":1954},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:18.717296Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:5017f231848b3c250fc9ed9f26b5eaf73b1fca4238f2c8ffad1c9142a25550b7","observation_id":"f9d15dd1-95b6-451b-9db0-c16b4e82739a","resolution":{"observed_at":"2026-08-01T03:01:18.717296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-01T03:01:18.871503Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:18.871503Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:65e4dbb42c5fc4534e23f40ce602b340942f12de11c341b667b4295a2426fdfc","observation_id":"6cd9dcdb-a81c-4c96-9338-50e5ac12d238","resolution":{"observed_at":"2026-08-01T03:01:18.871503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:18.974352Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:18.974352Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:17739fd497f101523dbc59a89bd4cd290c25bc403001f04a273f7a510003b605","observation_id":"8e000303-a304-4947-9f9e-7ef54626ffa5","resolution":{"observed_at":"2026-08-01T03:01:18.974352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-01T03:01:19.137233Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:19.137233Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:d7828a2bc7b506fd292261e40514296000684aec893384acb93cc2944e3cb7f1","observation_id":"3a9d7fb5-567f-4ff5-b1f6-02ce4478bff6","resolution":{"observed_at":"2026-08-01T03:01:19.137233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:19.238569Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:19.238569Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:1afadb0941cd128830c52becb9fd2c9f73c3d72e472f4430941996a3cc8b460c","observation_id":"9759e292-e59d-416d-a8ba-c172e26165e1","resolution":{"observed_at":"2026-08-01T03:01:19.238569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:19.371320Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:19.371320Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:41827557166b22249cd48c07851ce2ea71f35a0a05edf02394aa960f564e1424","observation_id":"621acc54-4427-4c9f-b862-ae0e9853e544","resolution":{"observed_at":"2026-08-01T03:01:19.371320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:19.699746Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:19.699746Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:20a60e85460ab2212263b7e3163fb232097fa3c63927041071f77421ab74c27b","observation_id":"b160c100-80d1-4e4b-86a4-2d37fb870465","resolution":{"observed_at":"2026-08-01T03:01:19.699746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:19.808427Z","title":null,"venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:19.808427Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:7c60bb865bfa5953ccd285bc8c2fd85d0730b4ebf77abd8fa96ff650e7140235","observation_id":"ab46e9a9-34a6-4988-9d5b-f6d1e3e11d8f","resolution":{"observed_at":"2026-08-01T03:01:19.808427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:19.899237Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:19.899237Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:5d03bcdd808993147d8391c35bda3d37c997e65a834cffcfff361074afdb8142","observation_id":"b326780e-32d6-4a00-85fe-67fe4cd1d98a","resolution":{"observed_at":"2026-08-01T03:01:19.899237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.22180","last_updated":"2026-04-24T03:11:51Z","snapshot_observed_at":"2026-08-05T04:03:20.809109Z","submitted_at":"2026-04-24T03:11:51Z","title":"ResRank: Unifying Retrieval and Listwise Reranking via End-to-End Joint Training with Residual Passage Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.22180","snapshot_observed_at":"2026-08-01T03:01:20.101304Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:20.101304Z"},"links":{"cited_paper":"/paper/2604.22180","citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:cde1c55e039a3be3b68a30e250a5bd4f8181e378bc0f60c77a27ad4b7c36676b","observation_id":"111423ad-ba3a-4609-92a6-eb46f48c20dd","resolution":{"observed_at":"2026-08-01T03:01:20.101304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:20.251351Z","title":null,"venue":null,"work_id":null,"year":1938},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:20.251351Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:435c3a28c5bf55a67f76a6667894c9b1eb3c9b1bbf4cf91a497497d94ea174c6","observation_id":"c587b037-db51-43db-bf49-6125fc061f90","resolution":{"observed_at":"2026-08-01T03:01:20.251351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:20.377994Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:20.377994Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:85317903126671e6a7d3bfbc83924720d41ed8b78a597f8d9a5168e37ac5e61c","observation_id":"5be588ea-8cbd-496b-9093-7d4f7f20bf6b","resolution":{"observed_at":"2026-08-01T03:01:20.377994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:20.518738Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:20.518738Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:dfe46edb8c3e1d9cc3af6e11b4cb0b34149074a4063ee14c6477dafdd45f1e2b","observation_id":"aaacb989-0d40-4bb6-8d16-19d9295fec36","resolution":{"observed_at":"2026-08-01T03:01:20.518738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:20.596827Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:20.596827Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:f9b70f065c49c70789ba765a4f1e4c9abd0b0b3037632d3dd2433242748cd1bb","observation_id":"00f38ea7-df1d-4ecb-979e-a9b04deffe2e","resolution":{"observed_at":"2026-08-01T03:01:20.596827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:20.694760Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:20.694760Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:6470adc9df637376caf4adc1d79b0c1e9a94a74ff0fd12d1d73b796b236b844b","observation_id":"bfcb413b-2428-461c-b10b-211322dd6c1e","resolution":{"observed_at":"2026-08-01T03:01:20.694760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:20.787470Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:20.787470Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:dfa96d53d8d3172bc4675a3590baa256dc41db8a8d41b0ea6616b67d024b2210","observation_id":"25146a8e-69ab-4931-bdc3-ad3097394e92","resolution":{"observed_at":"2026-08-01T03:01:20.787470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:20.965317Z","title":"1959.Individual choice behavior","venue":null,"work_id":null,"year":1959},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:20.965317Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:b5a41effea093aecb97be633cf66bfec0e90bf642b1d82bbb068c11edc9b9669","observation_id":"d2c7f9c6-9fac-4b93-9f1c-a727cc2a0a30","resolution":{"observed_at":"2026-08-01T03:01:20.965317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:21.042262Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:21.042262Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:c1873bb311684e1d62ad98cbf4e6fa48fe7f0b4c66b9dae923cef44844e205ed","observation_id":"d33dc88b-a3ae-408e-b462-cac9db31e033","resolution":{"observed_at":"2026-08-01T03:01:21.042262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:21.167768Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:21.167768Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:6019f6f08251259f722e64c2f913269ae5df43aee2e924a048fb8bf716b090fc","observation_id":"8cc5ee0f-718d-4db7-9c47-402fc22a286e","resolution":{"observed_at":"2026-08-01T03:01:21.167768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.14424","last_updated":"2019-10-31T12:45:40Z","snapshot_observed_at":"2026-08-07T15:38:16.188847Z","submitted_at":"2019-10-31T12:45:40Z","title":"Multi-Stage Document Ranking with BERT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.14424","snapshot_observed_at":"2026-08-01T03:01:21.260127Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:21.260127Z"},"links":{"cited_paper":"/paper/1910.14424","citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:6f3f36d2835c20445cc144d919d294d377969c4dc84b7d5895d8a9fa5eb4edd3","observation_id":"af57e2ab-9799-4576-bdb7-51e30eb368f0","resolution":{"observed_at":"2026-08-01T03:01:21.260127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:21.343707Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:21.343707Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:561fa7cf9b6b81742e5c2435ee30d61845819acc891d3f80d14f30e1c92fd3fe","observation_id":"27d16ce6-122a-4182-ae65-a49defa27614","resolution":{"observed_at":"2026-08-01T03:01:21.343707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:21.532912Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:21.532912Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:990b7932395aae8b0547d6ebae517b615ae27f5f96f9b844b87e4dc6273354b2","observation_id":"e4c5265d-bef5-4455-aee1-82286187e4c2","resolution":{"observed_at":"2026-08-01T03:01:21.532912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:21.686790Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:21.686790Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:b84ec3580ba51424998f78743a68c62270e318959bdc4305554c2aeddecb901d","observation_id":"02b70b02-fad8-461d-bced-2abcfe8cb292","resolution":{"observed_at":"2026-08-01T03:01:21.686790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:21.844763Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:21.844763Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:c8f86e4bc8b18fdd2fe19b525a0241c09978dc46b2b334fe3d39dcd72960cbd1","observation_id":"d969230f-e791-4023-994e-2d0c4fd257d4","resolution":{"observed_at":"2026-08-01T03:01:21.844763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:22.054999Z","title":null,"venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:22.054999Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:3bdad6967af62e317ee78d57ed701971b9b14f00ae5acd6fc6230cacce62ffe4","observation_id":"abc5775b-d139-48f7-b50c-afeff045e8cb","resolution":{"observed_at":"2026-08-01T03:01:22.054999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15088","last_updated":"2023-09-26T17:31:57Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:31:57Z","title":"RankVicuna: Zero-Shot Listwise Document Reranking with Open-Source Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15088","snapshot_observed_at":"2026-08-01T03:01:22.122989Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:22.122989Z"},"links":{"cited_paper":"/paper/2309.15088","citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:b613a2a305e50721bb3dc7f71eb6bb7740e6bf1a26908a7526d777e71e25b877","observation_id":"56a30392-8bef-4e98-b4ff-7c1e79ef25f7","resolution":{"observed_at":"2026-08-01T03:01:22.122989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02724","last_updated":"2023-12-05T12:39:00Z","snapshot_observed_at":"2026-07-06T16:57:09.664139Z","submitted_at":"2023-12-05T12:39:00Z","title":"RankZephyr: Effective and Robust Zero-Shot Listwise Reranking is a Breeze!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02724","snapshot_observed_at":"2026-08-01T03:01:22.207482Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:22.207482Z"},"links":{"cited_paper":"/paper/2312.02724","citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:3589bc95ebac21f4146653b6611d8a00b59d8b8c884f035369b78c5891ce0426","observation_id":"d37ff3e0-5ebf-4dc3-8ae5-9d1b58433879","resolution":{"observed_at":"2026-08-01T03:01:22.207482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1306.2597","last_updated":"2013-06-09T09:58:00Z","snapshot_observed_at":"2026-07-06T03:15:36.962567Z","submitted_at":"2013-06-09T09:58:00Z","title":"Introducing LETOR 4.0 Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.2597","snapshot_observed_at":"2026-08-01T03:01:22.270958Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:22.270958Z"},"links":{"cited_paper":"/paper/1306.2597","citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:9b7e58a530b49611a0c04c8d7a31ff9a2f50eaf160f57f09a21cd9d8b97185a3","observation_id":"de7f1eef-fee4-43d3-b4c5-a19c6e2f00c5","resolution":{"observed_at":"2026-08-01T03:01:22.270958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:22.311935Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:22.311935Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:818018e623f223d5eea2de01ec6732c997659f8851f90aea8df5943350154075","observation_id":"f885ebc8-af7f-4b15-822f-13f399d2643b","resolution":{"observed_at":"2026-08-01T03:01:22.311935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:22.388835Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:22.388835Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:f72f037159c633d1c2d17d438b05ada651f01d9cc6f44a1e0d4d26df3dfa2d40","observation_id":"dbbd6092-8ef8-44ae-a6e7-10d7c7871cf4","resolution":{"observed_at":"2026-08-01T03:01:22.388835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:22.532094Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:22.532094Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:ddcc00244b282e4ff11fe723a3687778ce3a744690b118af7ed0ce9e9458ec5a","observation_id":"da938034-c4c5-4c8f-bd7e-4106cb714c4c","resolution":{"observed_at":"2026-08-01T03:01:22.532094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T03:01:22.693562Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:22.693562Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:2266b368feec453847476193642104a47631d550cdb935e5f67e8ed8fb1a5698","observation_id":"640bab89-68ed-459a-a623-bdbc0af42161","resolution":{"observed_at":"2026-08-01T03:01:22.693562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:22.789677Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:22.789677Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:c0d73866dd15173d3681b475fef6fb125b304c3eb3d97c74b2054068d1952e3d","observation_id":"0c71f43d-3b43-4e0f-aebb-e127deb92b6f","resolution":{"observed_at":"2026-08-01T03:01:22.789677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:22.820708Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:22.820708Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:adf97ec01ebab5b904348c6950f70ee8b88c9473cc60ec747e83cdf4c0d84dcf","observation_id":"85792aa6-aecf-45bb-adf0-e320b4527ab4","resolution":{"observed_at":"2026-08-01T03:01:22.820708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:22.858938Z","title":null,"venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:22.858938Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:929e08a8f1c9cfae10d11129793bb44e9d95a10c93934f7b861d7336ffd583c3","observation_id":"b6ea7e19-50ae-4abe-85a7-04d00103b421","resolution":{"observed_at":"2026-08-01T03:01:22.858938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:22.985620Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:22.985620Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:c994d1c0c1e1b1063e0460103aeb36752c1445eb50f0e429ce5de8124860ae6f","observation_id":"95755430-5cba-43d7-97cf-6ffa46b4ca0f","resolution":{"observed_at":"2026-08-01T03:01:22.985620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-01T03:01:22.610813Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:22.610813Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:3d6b341d1281e015c7c3b0e9a81d6f7db74a06054b9c7d6fcf897f3bcab6fab3","observation_id":"4b1a70ae-0722-46af-ae85-73e0cf6f97c9","resolution":{"observed_at":"2026-08-01T03:01:22.610813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:23.179275Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:23.179275Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:eb7d391e02b8955077f76aeded10ac337883adc3c93970ca0df124dedeb3acbb","observation_id":"84138262-335a-49d0-a4cc-f924b7053814","resolution":{"observed_at":"2026-08-01T03:01:23.179275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08663","last_updated":"2021-10-21T01:18:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-04-17T23:29:55Z","title":"BEIR: A Heterogenous Benchmark for Zero-shot Evaluation of Information Retrieval Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08663","snapshot_observed_at":"2026-08-01T03:01:23.275316Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:23.275316Z"},"links":{"cited_paper":"/paper/2104.08663","citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:d644f72ee732cf5fac55b6a877d6c0bab2da4dbd2056885dff22d1ec087c23dc","observation_id":"e4934d58-fe93-41eb-9719-5c73217016f1","resolution":{"observed_at":"2026-08-01T03:01:23.275316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:23.472799Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:23.472799Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:3f9ae2c11a4e43e158fda77edf09ccbef0dca6f310c33d28c9e68a0622d8d965","observation_id":"71e8704a-85c4-4b4d-9554-63de3abb5776","resolution":{"observed_at":"2026-08-01T03:01:23.472799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:23.605370Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:23.605370Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:5466fa6ad82afd68794e09d5d3c948836c94a91dba9dfbe48f728e4939032a49","observation_id":"a829f6b3-6f15-4b0c-8e8f-6019b7dee70e","resolution":{"observed_at":"2026-08-01T03:01:23.605370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:23.758728Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:23.758728Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:5065e5ebd436c58ba0c6abf8c6307523442b13d95d16202782c37313aa2137ae","observation_id":"1e435842-a3c3-47fc-b280-52e331ed49e9","resolution":{"observed_at":"2026-08-01T03:01:23.758728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:23.065320Z","title":"1998.Reinforcement learning: An intro- duction","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:23.065320Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:63164116f31f5dec8a9a37b2cb51f79e4a8f5ec0d481bc16db12eff23d083a57","observation_id":"2667339f-b3d3-4166-bc19-124c6aa7986b","resolution":{"observed_at":"2026-08-01T03:01:23.065320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:23.923879Z","title":null,"venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:23.923879Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:20f7f76f3d826abae3e87beedd49d38d5ab5b65d97b0bcef253f7ba03f3b9acb","observation_id":"d0c28e56-2f6e-4310-99bd-4574827e5ce4","resolution":{"observed_at":"2026-08-01T03:01:23.923879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:24.054502Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:24.054502Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:1da348b465eb58ad385a1890a7080e4733631dd5c923d74c807f6d0cefe07b46","observation_id":"c9aefb56-2eec-4f7b-bb48-bea43650f4ed","resolution":{"observed_at":"2026-08-01T03:01:24.054502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T03:01:24.242635Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:24.242635Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:2ba9297e5b66f0c7f3455b8e700dc5fd42774a805d3c2728f90e5f9852ab4dae","observation_id":"acaf6952-6bd9-47ab-8290-19539b55b6a2","resolution":{"observed_at":"2026-08-01T03:01:24.242635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:24.420370Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:24.420370Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:49fcffd78a281c91233c2a2deec3b83ce25423b6f53f03ce84980f6021898615","observation_id":"52442d5d-9910-4248-a03b-8eb152fd2bf3","resolution":{"observed_at":"2026-08-01T03:01:24.420370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:24.634546Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:24.634546Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:b45358706b5dd5f0cc573f1553990475e9af4be158f088c1cfa897d16a48f824","observation_id":"779b3b69-b1a9-4f25-9058-6510fa81b848","resolution":{"observed_at":"2026-08-01T03:01:24.634546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:23.861110Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:23.861110Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:133492bf087124ad4736b42f3156643cca20e0501cd5c3666e672fde2a2fbf56","observation_id":"776d8646-d98a-4801-99db-4b6b30b86968","resolution":{"observed_at":"2026-08-01T03:01:23.861110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-01T03:01:24.911978Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:24.911978Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:2c6217f0eb5e14cc1c2057f1a335ed023b9ce4d0b3abe6574bb8b5c15005d987","observation_id":"fe66a1f1-22b6-4412-8c6b-1268e0c1080f","resolution":{"observed_at":"2026-08-01T03:01:24.911978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06034","last_updated":"2025-03-08T03:14:26Z","snapshot_observed_at":"2026-08-07T17:20:46.152437Z","submitted_at":"2025-03-08T03:14:26Z","title":"Rank-R1: Enhancing Reasoning in LLM-based Document Rerankers via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06034","snapshot_observed_at":"2026-08-01T03:01:25.036117Z","title":"∗\" indicates signifi- cantly better than the best supervised learning method (un- derlined) at the 𝑝< 0.05level using the two-tailed pairwise t-test","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:25.036117Z"},"links":{"cited_paper":"/paper/2503.06034","citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:e01dc3f0abe5b409ab9ecadee5ad9d27a9e42366264a052999d1b9b59c0d26ce","observation_id":"dcd18336-5306-48b5-9cf0-b10f2085c974","resolution":{"observed_at":"2026-08-01T03:01:25.036117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:24.760359Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:24.760359Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:09d197fc01de93fa37f734447e51f842463719ebb2bb32decefffaef9f97961f","observation_id":"e329d2b5-771b-4ef9-850d-b193bc9f42c2","resolution":{"observed_at":"2026-08-01T03:01:24.760359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-08T15:29:26.223468Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-01T03:01:22.451123Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:22.451123Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:d3d2c696fd7a1a1c9c1cb7b503159c609e9fe4a7cd3555a3bac6ac4ea8850925","observation_id":"e716d369-17a9-4fbf-9846-1853a89079c7","resolution":{"observed_at":"2026-08-01T03:01:22.451123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:19.562084Z","title":"InAcm Sigir Forum, Vol","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:19.562084Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:d954d86f8c0a75b37355045ad3042d9b1771d68cde4c17875b971a6e02407efd","observation_id":"94d6483f-4ac7-4476-9ae7-0f52b18d10b6","resolution":{"observed_at":"2026-08-01T03:01:19.562084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:21.970942Z","title":"InProceedings of the 43rd international ACM SIGIR conference on research and development in information retrieval","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:21.970942Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:f33c958f54945c36c8adc03225855a87651f247c2183ae0ffafbe421fec3c51f","observation_id":"f5f4abf5-d655-4a49-aaeb-34d09d5184cf","resolution":{"observed_at":"2026-08-01T03:01:21.970942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:01:18.101470Z","title":"InProceedings of the AAAI conference on artificial intelligence, Vol","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:18.101470Z"},"links":{"citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:12bf87fa9d4dc5636b205017b82a31fcef6135b1b2dc409801306ee75a82347a","observation_id":"1b49a1b0-69ea-44f4-b24b-9c1afbe38a32","resolution":{"observed_at":"2026-08-01T03:01:18.101470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04407","last_updated":"2024-11-23T16:00:51Z","snapshot_observed_at":"2026-07-06T16:28:51.154391Z","submitted_at":"2023-10-06T17:55:23Z","title":"Policy-Gradient Training of Language Models for Ranking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04407","snapshot_observed_at":"2026-08-01T03:01:18.419133Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:18.419133Z"},"links":{"cited_paper":"/paper/2310.04407","citing_paper":"/paper/2607.25268"},"observation_digest":"sha256:abe55755315d2edd1974685b06748c484c18b2924d1dc0d2eb75cd10e8e6c4af","observation_id":"4bbcd023-c445-446b-8b95-131f8f0421d5","resolution":{"observed_at":"2026-08-01T03:01:18.419133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.25268","last_updated":"2026-07-28T04:13:47Z","latest_version":1,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-06T03:59:26.554159Z","submitted_at":"2026-07-28T04:13:47Z","title":"Structure-aware Relative Policy Optimization for Ranking"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":78,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 0 inbound Pith citation observations for arXiv:2607.25268."}