{"as_of":"2026-08-15T01:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a2006305627e37d93c792313c33249fc247ed48bab7ede9996c4bb047660e3f1","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:53:12.499757Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T19:27:17.802597Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-10T12:15:01.137692Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"cited_work":{"arxiv_id":"2510.08048","doi":"10.48550/arxiv.2510.08048","metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08048","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":null,"venue":null,"work_id":"425fd305-260e-42e3-b572-3237a26e487a","year":2025},"citing_paper":{"arxiv_id":"2602.23620","last_updated":"2026-04-27T03:42:57Z","snapshot_observed_at":"2026-08-11T05:12:13.902859Z","submitted_at":"2026-02-27T02:53:17Z","title":"Synthetic Data Powers Product Retrieval for Long-tail Knowledge-Intensive Queries in E-commerce Search","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T19:27:17.802597Z"},"links":{"cited_paper":"/paper/2510.08048","citing_paper":"/paper/2602.23620"},"observation_digest":"sha256:719550dc5bbd7c9d7a00ba24b267f844a8c1c535a8f70f2dd67b54955a8f9935","observation_id":"1f86f5e7-f68a-4dca-baf8-2f190263c6a5","resolution":{"observed_at":"2026-07-07T03:17:12.927851Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"cited_work":{"arxiv_id":"2510.08048","doi":"10.48550/arxiv.2510.08048","metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08048","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":null,"venue":null,"work_id":"425fd305-260e-42e3-b572-3237a26e487a","year":2025},"citing_paper":{"arxiv_id":"2604.25683","last_updated":"2026-04-28T14:12:39Z","snapshot_observed_at":"2026-08-13T19:41:11.404041Z","submitted_at":"2026-04-28T14:12:39Z","title":"K-CARE: Knowledge-driven Symmetrical Contextual Anchoring and Analogical Prototype Reasoning for E-commerce Relevance","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-07T15:28:44.678081Z"},"links":{"cited_paper":"/paper/2510.08048","citing_paper":"/paper/2604.25683"},"observation_digest":"sha256:96564c45db519af4a972eb269b329b68af072806c6b3fd969a44187bb30098dc","observation_id":"0087070d-441f-4858-89c9-78506279a086","resolution":{"observed_at":"2026-07-07T03:17:12.927851Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2510.08048/citation-record","integrity":"/paper/2510.08048/integrity","json":"/paper/2510.08048/citation-record.json","paper":"/paper/2510.08048"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:06.813916Z","title":null,"venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:06.813916Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:9b180e99af2b456aa70e556d6d5cbcb6aa4dd0f2f0ed23c73f72d956fa68e150","observation_id":"d4776558-b14b-4346-a29c-313ad2cf4861","resolution":{"observed_at":"2026-08-04T10:53:06.813916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:06.876600Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:06.876600Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:466cdd4ba193d22a330d4ee9a6cca9d0602fe1674bb4cdcf5bd88207b82f1266","observation_id":"17158c38-5797-4a8f-b40e-c7524912d7e9","resolution":{"observed_at":"2026-08-04T10:53:06.876600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:06.913693Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:06.913693Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:d5883fe5ea3a47c9a56f4e1f779e0a630e77fbbd1562f81f3e714fb27d92f234","observation_id":"14f14b6d-bbf2-4d64-ab39-0715baae8e00","resolution":{"observed_at":"2026-08-04T10:53:06.913693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:06.966825Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:06.966825Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:ed517fc08da97b6de552e227eb91ec7c2538407f59e3a883566dd7660e7afb0e","observation_id":"6ea9a0cc-9ee5-4cb4-bf21-5dc92a896cab","resolution":{"observed_at":"2026-08-04T10:53:06.966825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-04T10:53:07.048784Z","title":"Le, Sergey Levine, and Yi Ma","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:07.048784Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:86de2073084e6e6f49df4e9dcd026b1b7d2a6a61e48351cc87940a8e442f2353","observation_id":"19ee9732-5b7e-412e-bce6-4021e1b15ebf","resolution":{"observed_at":"2026-08-04T10:53:07.048784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-04T10:53:07.123147Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:07.123147Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:440b32fda9685db7a7762045e8e2399b93b24ce9eb63da360892e6ae40f90de7","observation_id":"8f0edeb4-5518-4f7c-ad17-b3878085ebe7","resolution":{"observed_at":"2026-08-04T10:53:07.123147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T10:53:07.232318Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:07.232318Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:010ffe4f48a5a640449cddcfb04b78e73629254d28ec9455b2d338be016db44d","observation_id":"d4e1c867-3bf8-4f43-ab92-765e2712d7a1","resolution":{"observed_at":"2026-08-04T10:53:07.232318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:07.376532Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:07.376532Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:78572cc57f8f5de02c4fa3d5d5bb9496dfa63c0aea0934b5f83e962b189df076","observation_id":"dbadd8c7-f774-4d60-bddd-95d24b3e29bb","resolution":{"observed_at":"2026-08-04T10:53:07.376532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:07.521983Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:07.521983Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:923efa542b0ed690974e93c77fc4472838e00abdc3bfdc2a088f674074c4cc89","observation_id":"66057b99-1e90-4006-9ef7-f250c3b6ae66","resolution":{"observed_at":"2026-08-04T10:53:07.521983Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:07.624556Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:07.624556Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:6ca2f63f4b4ad2778f3dd0a1e4d5645154b764785ad863c46fb29e456d85c419","observation_id":"c486bdb2-97f6-43d8-9f28-b573a0b765de","resolution":{"observed_at":"2026-08-04T10:53:07.624556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:07.720624Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:07.720624Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:8c24d6d835eb533990fccc7d661afb08fa87a68e63850e39969fd24cbba043f5","observation_id":"74609662-e9ec-4c31-9b32-d63db4327337","resolution":{"observed_at":"2026-08-04T10:53:07.720624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-04T10:53:07.864133Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:07.864133Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:f5ffa88328fc124500f074680139fd1b2b8a752acd66b003228b74b8f3f5bedb","observation_id":"d63d37f7-3e97-45d9-8c41-6a220bdba68b","resolution":{"observed_at":"2026-08-04T10:53:07.864133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-13T06:43:22.011336Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-04T10:53:07.943286Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:07.943286Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:f36c3674feb5bafd789b600110d3c54f58ec4a5601c8c2b5f14e1095c14ed134","observation_id":"b40857a2-b4f1-4ddf-88c5-fe132cf4ca19","resolution":{"observed_at":"2026-08-04T10:53:07.943286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-13T00:59:58.573803Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-04T10:53:08.022212Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:08.022212Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:4c2042db9f6f5555f5929984ddf157e5bd49c787b28ca462c93387abb2a2212e","observation_id":"7c481f30-7042-4931-9867-16411b6c3d47","resolution":{"observed_at":"2026-08-04T10:53:08.022212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06457","last_updated":"2024-08-14T02:41:48Z","snapshot_observed_at":"2026-08-14T21:37:10.712741Z","submitted_at":"2024-02-09T15:02:56Z","title":"V-STaR: Training Verifiers for Self-Taught Reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06457","snapshot_observed_at":"2026-08-04T10:53:08.114591Z","title":"Courville, Alessandro Sor- doni, and Rishabh Agarwal","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:08.114591Z"},"links":{"cited_paper":"/paper/2402.06457","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:7c12743cfbfac6c1f92a081c055801714991d2845af33867a058a0f700afec35","observation_id":"f0a69c2f-ff18-4b32-8a53-0770e230e8fe","resolution":{"observed_at":"2026-08-04T10:53:08.114591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:08.181854Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:08.181854Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:aca0306f52caef0cd3a5d982c7123c77f24a03adc78e6b888ca011a690a3e728","observation_id":"d40c7261-d733-4f21-b951-b6c3b7de3e0c","resolution":{"observed_at":"2026-08-04T10:53:08.181854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-04T10:53:08.220029Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:08.220029Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:4a42464e711fe9af300fcc2f95fc87985a47adea795e66fac53b0adc5efbd5c0","observation_id":"180f8dfb-2cea-4771-a861-afbe7e63938b","resolution":{"observed_at":"2026-08-04T10:53:08.220029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19153","last_updated":"2024-11-01T16:47:59Z","snapshot_observed_at":"2026-08-13T07:04:45.188272Z","submitted_at":"2024-05-29T14:59:49Z","title":"A Study of Plasticity Loss in On-Policy Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19153","snapshot_observed_at":"2026-08-04T10:53:08.287562Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:08.287562Z"},"links":{"cited_paper":"/paper/2405.19153","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:22c46563c87ee6d00100a92c887360a7f8ee4e446f146a225c1db9b2a416b99d","observation_id":"6175ae2b-d845-479c-b20a-350fee2eb1da","resolution":{"observed_at":"2026-08-04T10:53:08.287562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:08.355132Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:08.355132Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:89566d414f109dc664a91020814727a65874071f5e7227696a30370776f6b3d9","observation_id":"4f94b7ac-1717-4bf1-99c2-0a696b6575f8","resolution":{"observed_at":"2026-08-04T10:53:08.355132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:08.424629Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:08.424629Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:5316148e13bc2264fd280653da257d481da1e29f41fd60a202325d449bfe533a","observation_id":"188aae36-e751-45d8-9c83-e3f9a25cde77","resolution":{"observed_at":"2026-08-04T10:53:08.424629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01478","last_updated":"2025-01-02T12:09:17Z","snapshot_observed_at":"2026-08-14T04:11:00.447264Z","submitted_at":"2025-01-02T12:09:17Z","title":"Enhancing Reasoning through Process Supervision with Monte Carlo Tree Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01478","snapshot_observed_at":"2026-08-04T10:53:08.542610Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:08.542610Z"},"links":{"cited_paper":"/paper/2501.01478","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:865143c520e98f6d0d31d80b2b33e95328f253c2de51c952e3326c454d802178","observation_id":"6a4c5a46-318a-46b7-b102-08b4c8236c83","resolution":{"observed_at":"2026-08-04T10:53:08.542610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:08.603311Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:08.603311Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:89cb66da2196504fd47343adea665644fdb2bb9f9593bb946ed9e7d96005f4bc","observation_id":"a32544b8-85f4-4acc-adbb-b4baf62aa0ad","resolution":{"observed_at":"2026-08-04T10:53:08.603311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-14T15:23:56.583688Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-08-04T10:53:08.661292Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:08.661292Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:3aff7685c267bb6b1df537e519fe723ad1f64793cd0abb13ba22584ab62a2538","observation_id":"11411b44-0b68-42f9-aeb6-eab51a369da2","resolution":{"observed_at":"2026-08-04T10:53:08.661292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.04085","last_updated":"2020-04-14T14:57:40Z","snapshot_observed_at":"2026-08-12T23:25:05.204139Z","submitted_at":"2019-01-13T23:27:58Z","title":"Passage Re-ranking with BERT","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.04085","snapshot_observed_at":"2026-08-04T10:53:08.718998Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:08.718998Z"},"links":{"cited_paper":"/paper/1901.04085","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:2e853e3d6473d2b89ab140e0e58982c4148e903ff840063bd1fd7b61f8762530","observation_id":"9d902ca6-1795-492b-99ce-79f74f15bf14","resolution":{"observed_at":"2026-08-04T10:53:08.718998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00114","last_updated":"2021-11-30T21:32:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-11-30T21:32:46Z","title":"Show Your Work: Scratchpads for Intermediate Computation with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00114","snapshot_observed_at":"2026-08-04T10:53:08.788211Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:08.788211Z"},"links":{"cited_paper":"/paper/2112.00114","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:3c3448b6ebcd3d12eb482276400fd17679e95933cf586e0f54d9acce9a88eb2c","observation_id":"e9650e6d-1eac-4f64-9e69-2b5cda75e202","resolution":{"observed_at":"2026-08-04T10:53:08.788211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-04T10:53:08.866608Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:08.866608Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:a73ac704056745ac3aa3a0a1ff770a26acf210416f6b1bf0af4e888f9541741f","observation_id":"292be729-1e32-40da-9838-6f0a080823f7","resolution":{"observed_at":"2026-08-04T10:53:08.866608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18420","last_updated":"2025-08-25T19:10:58Z","snapshot_observed_at":"2026-08-05T16:28:46.297706Z","submitted_at":"2025-08-25T19:10:58Z","title":"LLM-Driven Intrinsic Motivation for Sparse Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18420","snapshot_observed_at":"2026-08-04T10:53:08.945022Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:08.945022Z"},"links":{"cited_paper":"/paper/2508.18420","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:6b740fa3d695eb3a893106b859f6e18fe5ff560bc143c0bce363542f36109a46","observation_id":"07f689de-5442-481b-b2ce-fab67f6074f1","resolution":{"observed_at":"2026-08-04T10:53:08.945022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-04T10:53:09.015333Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:09.015333Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:a9da95543d75a0c78d6fd4c20aa0faf7145058b0c5adc6c2ef9080faa56a015c","observation_id":"16b7bb27-178a-4e87-bbb9-8aca8f4efa76","resolution":{"observed_at":"2026-08-04T10:53:09.015333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18099","last_updated":"2025-07-08T09:49:57Z","snapshot_observed_at":"2026-08-14T01:52:31.273377Z","submitted_at":"2025-01-30T02:21:59Z","title":"Learning to Plan & Reason for Evaluation with Thinking-LLM-as-a-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18099","snapshot_observed_at":"2026-08-04T10:53:09.093199Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:09.093199Z"},"links":{"cited_paper":"/paper/2501.18099","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:3673a0388e717ae58d121f704ac33c60ae1cbc974e0bfdfeab3bab3676d677c8","observation_id":"2055a67a-652b-4683-a375-b6c463c0399d","resolution":{"observed_at":"2026-08-04T10:53:09.093199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03524","last_updated":"2025-06-05T03:26:05Z","snapshot_observed_at":"2026-08-13T13:37:23.026438Z","submitted_at":"2025-06-04T03:17:19Z","title":"Seed-Coder: Let the Code Model Curate Data for Itself","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03524","snapshot_observed_at":"2026-08-04T10:53:09.168062Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:09.168062Z"},"links":{"cited_paper":"/paper/2506.03524","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:ace860bfe6e744d83e0f1409442f32903657712e26ef7f22e0ac05305971ea8b","observation_id":"6047bd7e-680c-478d-9606-c39ef50e21c0","resolution":{"observed_at":"2026-08-04T10:53:09.168062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T10:53:09.237921Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:09.237921Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:4f434026f8bc5f6774d010b11491bfa11fc29a2a7e61ed1398dd086dc55ab60f","observation_id":"e9a35561-696a-49d8-953a-0e4456d84efd","resolution":{"observed_at":"2026-08-04T10:53:09.237921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:09.317845Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:09.317845Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:f7a2423e8aa9348e894d9ed71f45c8bfeb62124c035d84f3390e1a80e28c6288","observation_id":"190731fb-787c-4547-aea5-b2772cdd64d4","resolution":{"observed_at":"2026-08-04T10:53:09.317845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:09.467665Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:09.467665Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:c6aa4969c89fd5fabb5de68465cd6b59ab9abe87a0c1fad468de349f0620a94a","observation_id":"7c50dd99-db9d-4b5c-a77a-c5f41bbaf12d","resolution":{"observed_at":"2026-08-04T10:53:09.467665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:09.563069Z","title":"Svore and Christopher J.C","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:09.563069Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:025a18c7525298168bdf23ef6e6cd92155ef911c2dd202404e889640f1bd66f3","observation_id":"3b27a105-e121-4ea0-b3ca-cdedb13ce357","resolution":{"observed_at":"2026-08-04T10:53:09.563069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:09.610992Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:09.610992Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:70a5f12c9822de35a0589e282378a10e15cbcda8b77077f72dfd93f3e4672417","observation_id":"4bd72136-490c-47fc-8d15-5f0bcba62315","resolution":{"observed_at":"2026-08-04T10:53:09.610992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:09.647203Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:09.647203Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:dbd8de74d95caff5a3d89a687546e6b0179a9ecb7804cb5f9dc0639d43de0e6c","observation_id":"f535e962-0cea-4939-880a-c2b5915eb6ad","resolution":{"observed_at":"2026-08-04T10:53:09.647203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-04T10:53:09.715085Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:09.715085Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:6c00afc91b84a36af3fd761f58c90f9d3dde7f9cb6e01fc6242fbb972a76a06a","observation_id":"1908b08b-7257-48ef-86a5-d1e67b8ac8e7","resolution":{"observed_at":"2026-08-04T10:53:09.715085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-13T17:30:05.303052Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-08-04T10:53:09.781696Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:09.781696Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:735bfb7f6fc18103780d70b1a9811b97f16734d6bba47ef807d0366a2b1c178b","observation_id":"ff131638-77fc-41eb-bd47-63dfda5b131e","resolution":{"observed_at":"2026-08-04T10:53:09.781696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-04T10:53:09.842462Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:09.842462Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:1ac2a58f1587bc2db34cf91cf6bf613c9dfe1c7a3f7195b4db185a98344e0a16","observation_id":"03bf37e0-7be3-4c0b-94c2-d2a2857d85c4","resolution":{"observed_at":"2026-08-04T10:53:09.842462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T10:53:09.989206Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:09.989206Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:b3d2debfb2f9075f9e9f96d054b97f1148eb2d87d8339472928de22094d7ea3d","observation_id":"fede5782-71b7-4a70-bb3d-1a35c1d150d9","resolution":{"observed_at":"2026-08-04T10:53:09.989206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:10.105189Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:10.105189Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:492644b0946c4a3a893fef1e3fa48b3c22b2a1dcca530e977e91d3f1ec1feb34","observation_id":"02c16df3-b86f-4b5d-a211-95fd29048e87","resolution":{"observed_at":"2026-08-04T10:53:10.105189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-04T10:53:10.259947Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:10.259947Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:c4952a72eac6a7d79186601dc538ebaeaf98ab85ad1361a0dcd41f04b50e39d6","observation_id":"e9e39826-6a62-4149-a3fa-a5f00ddd7bec","resolution":{"observed_at":"2026-08-04T10:53:10.259947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:10.374837Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:10.374837Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:2a560328449c7ae7a168616898818a87cc89eca722ef5e868b71397c0a1e8ce7","observation_id":"b05400e5-2a05-404f-845b-3a0f5569c5a6","resolution":{"observed_at":"2026-08-04T10:53:10.374837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:10.552125Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:10.552125Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:dad243e8866635f429ef09fb5eb8fc8e57caa4f719ed071c2c68c302f01666f1","observation_id":"2cab5881-6639-4941-b133-9639d1c52f32","resolution":{"observed_at":"2026-08-04T10:53:10.552125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-04T10:53:10.151336Z","title":"arXiv:2503.14476 [cs.LG] https://arxiv.org/abs/2503.14476","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:10.151336Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:0eac0e852a7100b90c76540d8390ee25bd3fcf0a17f810ac794bc6afccf6c9f3","observation_id":"73cd5e14-6d18-4fe8-a88f-51686fe1fe90","resolution":{"observed_at":"2026-08-04T10:53:10.151336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:10.776382Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:10.776382Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:f3f6adec35066890dc0ea566905e936cbdaffd08e555c944dab236d066c695a0","observation_id":"03f4f0ee-7b24-455c-aa94-43efc46b328b","resolution":{"observed_at":"2026-08-04T10:53:10.776382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-08-04T10:53:10.877236Z","title":"cashmere clothing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:10.877236Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:b61cb2fff193c8309c134c6166208669b05e6702aa6fcb8fcc513135a046b1e4","observation_id":"27f1b512-88a9-4cbb-929a-98e9068fa0ce","resolution":{"observed_at":"2026-08-04T10:53:10.877236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02884","last_updated":"2024-11-21T07:07:59Z","snapshot_observed_at":"2026-08-12T22:31:19.889900Z","submitted_at":"2024-10-03T18:12:29Z","title":"LLaMA-Berry: Pairwise Optimization for O1-like Olympiad-Level Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02884","snapshot_observed_at":"2026-08-04T10:53:10.440907Z","title":"arXiv:2410.02884 [cs.AI] https://arxiv.org/abs/2410.02884","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:10.440907Z"},"links":{"cited_paper":"/paper/2410.02884","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:9332e22e7df17b9c702e97c8bde652bbe651623e6ee004d13aa814f8a9edd994","observation_id":"8602e035-1add-4b8e-b107-eb26c08f2193","resolution":{"observed_at":"2026-08-04T10:53:10.440907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-14T05:05:45.038648Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02841","snapshot_observed_at":"2026-08-04T10:53:10.631113Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:10.631113Z"},"links":{"cited_paper":"/paper/2507.02841","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:1de565fdd2b670434b669d262f73bf90a6ac3936ac5f04cb65c6f55aa27282e0","observation_id":"63ed6416-f211-42d3-8ae8-6792164f8643","resolution":{"observed_at":"2026-08-04T10:53:10.631113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:11.229914Z","title":"Undyed Cashmere Coat contains cashmere","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:11.229914Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:5ef014bbd60887ef330568767ad754f514e82a326d81f8127fe936bbd2911c1c","observation_id":"3960b980-434d-44fa-ad6a-b55140f46ade","resolution":{"observed_at":"2026-08-04T10:53:11.229914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:11.294586Z","title":"Relevance label is 4-Excellent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:11.294586Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:b3b1079b811e2b4cafa298f0a3bd168d5d2ae0ab75cbddedb0cd3b167fa72e02","observation_id":"3b9933cb-e7dc-4c12-8f03-8891239a1170","resolution":{"observed_at":"2026-08-04T10:53:11.294586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:11.468139Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:11.468139Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:a91b2d9dd855ab08e1c59cdadbaab9aae882151bfbd6ba7c63af3c9eab71945e","observation_id":"66931e4b-d4ef-4ecf-9f64-7b3201dd6bc6","resolution":{"observed_at":"2026-08-04T10:53:11.468139Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:11.603766Z","title":"Undyed Cashmere Coat contains cashmere, but the content is below 50%","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:11.603766Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:75ea4572f83d7e8801306315170203201e0d64ad648c0568588128bf0f2ab11d","observation_id":"c008981b-b227-4a8f-9726-370fc4d806d5","resolution":{"observed_at":"2026-08-04T10:53:11.603766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:11.682245Z","title":"chiffon dress","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:11.682245Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:8ea31d182362364a8e2e0bda672a8ce1ab0971e1a9511a1d24925b0c2389eb0b","observation_id":"ec4d19da-f532-4ab0-9cf6-b20cdc334408","resolution":{"observed_at":"2026-08-04T10:53:11.682245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:12.055879Z","title":"The dress contains chiffon, but the content is less than 50%","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:12.055879Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:e7a668f3a76912a75dc8a4ed61db10569ce65d97a93376a283aff512055dc1d9","observation_id":"4e7cbcae-0a8d-4da7-984c-fd477b74c166","resolution":{"observed_at":"2026-08-04T10:53:12.055879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:12.137741Z","title":"Relevance label is 2-Mismatch","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:12.137741Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:13872b1afb28c4208b56ac34dd01f2d14627205faf78098502735ddb99862fb9","observation_id":"88fa4c85-b240-4bee-a8e2-4f25f8b4bd2e","resolution":{"observed_at":"2026-08-04T10:53:12.137741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:12.209015Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:12.209015Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:fab68a6e7d0f08bcc24a3ed432ea322e6606a272e184117920641baa053228cb","observation_id":"389a4d66-81e1-42dd-8fbd-a2b41bcf6121","resolution":{"observed_at":"2026-08-04T10:53:12.209015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:12.280665Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:12.280665Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:eb51e84ee5c62d80ed8125f693d77b0460184bda09b9b41ba90ff9b80d981620","observation_id":"ffdf0d9c-5fa7-4d01-84c4-3858b2e39e21","resolution":{"observed_at":"2026-08-04T10:53:12.280665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:12.347899Z","title":"The conclusion is Excellent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:12.347899Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:a220dd41d958b1ae96d8c2b22c895b886d6d96fe29ee040117e5a1b7834bfd85","observation_id":"8a0c056b-2e2c-4a50-9ffd-d517cf316c4d","resolution":{"observed_at":"2026-08-04T10:53:12.347899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:12.424739Z","title":"The dress contains chiffon","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:12.424739Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:64c26c61c3a5447b244374f91f14ae56e91c50f540f1b659eb1d04eb8dc5c504","observation_id":"ce67b22d-60d8-4dc8-8c6f-2c7132176819","resolution":{"observed_at":"2026-08-04T10:53:12.424739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:53:12.499757Z","title":"Relevance label is 4-Excellent","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:12.499757Z"},"links":{"citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:14b915fb62642d886faa0b67cd997d91999a2421e097705f7a2d615ca740a8e2","observation_id":"f1253ef2-405a-426a-9426-d1c2c67fc721","resolution":{"observed_at":"2026-08-04T10:53:12.499757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.10995","last_updated":"2021-02-26T21:21:11Z","snapshot_observed_at":"2026-08-14T17:23:27.494191Z","submitted_at":"2019-01-30T18:40:37Z","title":"Go-Explore: a New Approach for Hard-Exploration Problems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.10995","snapshot_observed_at":"2026-08-04T10:53:07.774986Z","title":"arXiv preprint arXiv:1901.10995 (2019)","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:07.774986Z"},"links":{"cited_paper":"/paper/1901.10995","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:2dddf33f96a4293f29d6094cb52002b033f32671c54c794f8becca007fbdc9b0","observation_id":"05404bdc-9d67-4074-b0fe-25f965c19a8b","resolution":{"observed_at":"2026-08-04T10:53:07.774986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-04T10:53:08.480368Z","title":"arXiv:2406.18629 [cs.LG] https://arxiv.org/abs/2406.18629","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:08.480368Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:f053de0ff608a4fe011cbc31ff497f58bfac4b54a57121866d1d1ebdf45f2d92","observation_id":"c015ebd5-0bb5-4d99-86fc-21eb80bd959a","resolution":{"observed_at":"2026-08-04T10:53:08.480368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-14T07:24:06.483860Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-04T10:53:09.398856Z","title":"arXiv:2209.13085 [cs.LG] https://arxiv.org/abs/2209.13085","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:09.398856Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:ab06aa06fad9d7abb22ad8e1402b1c29dcf17db2f7aebc2263a2cf0b99284bb1","observation_id":"73dfea2d-def0-4b49-b3ad-a517d841eae6","resolution":{"observed_at":"2026-08-04T10:53:09.398856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","latest_version":4,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":62,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 2 inbound Pith citation observations for arXiv:2510.08048."}