{"as_of":"2026-08-04T01:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:649d558628123220e72f796c10ee94edd5495699a32ffec3ef20aa13d9df1368","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T04:34:28.214871Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.21967/citation-record","integrity":"/paper/2605.21967/integrity","json":"/paper/2605.21967/citation-record.json","paper":"/paper/2605.21967"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e13ab13c-92c8-4ccd-afbf-1269e5a96ca9","year":2023},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:8bffeaa0185a18e6353155f149f8fc0fe0a803136a7e606c3a80dbd7dff92e39","observation_id":"5f9ba59e-0296-4b24-b18a-f15a42058393","resolution":{"observed_at":"2026-05-22T04:34:35.644582Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5b41134d-a58c-41fb-91e3-07647d876ebd","year":null},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:e75d12fc0be15a8b5c34b5190f25b59cedd5df686d3d5dcadbb8b53e0b79b5b1","observation_id":"f81eb998-0c2d-49a0-a464-b926445ba0e2","resolution":{"observed_at":"2026-05-22T04:34:35.647847Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"InProceedings of the Nineteenth ACM Conference on Recommender Systems","venue":null,"work_id":"6c2b200e-4b82-41ed-8af7-358008cbc133","year":null},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:ec1b6996214db72bf40748cee18e57e98e89fe648224469dd82cd45e98b99d07","observation_id":"a43db1e8-bd24-4d81-abe4-ea6926ef74ec","resolution":{"observed_at":"2026-05-22T04:34:35.641722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a1706006-4d47-493d-afb2-519efccba14c","year":2025},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:ac40fd588b0b40d092dee6c8a99ca2097089cd2f9656955979ab32d5bf5bcf5b","observation_id":"dba4d269-451a-4dc5-9fe4-d32a52165094","resolution":{"observed_at":"2026-05-22T04:34:35.650634Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14900","last_updated":"2024-11-05T06:52:30Z","snapshot_observed_at":"2026-07-06T18:34:43.041841Z","submitted_at":"2024-06-21T06:47:28Z","title":"Decoding Matters: Addressing Amplification Bias and Homogeneity Issue for LLM-based Recommendation","version":3},"cited_work":{"arxiv_id":"2406.14900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14900","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoding matters: Addressing amplification bias and homogeneity issue for llm-based recommendation","venue":null,"work_id":"4f764b83-75a8-4499-a977-d6af5dc0467f","year":2024},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"cited_paper":"/paper/2406.14900","citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:fda62e652b9bc8ed843a73e4035b40621b4b9566b6ab146c150bcd20737d6265","observation_id":"68256a4f-22f4-424b-865b-8b34e5305d2e","resolution":{"observed_at":"2026-05-22T04:34:35.247882Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fee92b45-0746-413f-8359-de50368fb53d","year":2025},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:cabea5f25bb048351cc7811c122babf4c390e0345d5191d3f8f6db8c403f73de","observation_id":"901a19b3-4c19-41f0-80b9-d83604ae85d7","resolution":{"observed_at":"2026-05-22T04:34:35.642807Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ce7dfa72-b579-4b17-a2b8-c8adbd687251","year":2024},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:b4aedc9220ce1cad7111dbbf554f6ac058ff834506b6ab1b75107506f9da29f5","observation_id":"122bbed6-47e0-47fd-b3dd-992606c0360e","resolution":{"observed_at":"2026-05-22T04:34:35.645331Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T08:16:06.526490Z","title":null,"venue":null,"work_id":"6d35d3b2-5bfb-470a-8771-9513c607d8b6","year":2024},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:797f9d35b745ce14aacc2f4e28db7c6e8a240c76954e083dca9dc99c26a93b93","observation_id":"1ab0c19f-05e9-45a8-be37-e9f75abb17ad","resolution":{"observed_at":"2026-05-22T04:34:35.653555Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19678","last_updated":"2026-03-06T19:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-28T11:08:22Z","title":"From LLM Reasoning to Autonomous AI Agents: A Comprehensive Review","version":2},"cited_work":{"arxiv_id":"2504.19678","doi":"10.48550/arxiv.2504.19678","metadata_source":"pith","pith_arxiv_id":"2504.19678","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"From LLM Reasoning to Autonomous AI Agents: A Comprehensive Review","venue":"cs.AI","work_id":"54318454-2b12-4363-af3b-c33a86476992","year":2025},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"cited_paper":"/paper/2504.19678","citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:339635ef2f717a0d68ecd26b20a9f7cb0d65977a4c635407f7fc7b1cd217355d","observation_id":"6549db46-65d2-423e-81f1-298d9a728fb5","resolution":{"observed_at":"2026-05-22T04:34:35.339052Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a3213805-d407-4ecf-8dec-2825a89aa2eb","year":null},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:2b9e000ec783d19e7ea304237442f39dc7cec448861a16ae9bb36ecc888b20f6","observation_id":"52b78f38-31de-40c8-9f96-fee05a2476dc","resolution":{"observed_at":"2026-05-22T04:34:35.603854Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"InProceedings of the ACM on Web Conference 2025","venue":null,"work_id":"5a9764a0-a3b0-4b2f-8ba8-30431a003d49","year":2025},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:50936674c01dd27f24f45c056a29260687c3ce179d851d557a775414c7a63d2e","observation_id":"56454867-4fed-4f8e-8e7f-4954db91bd15","resolution":{"observed_at":"2026-05-22T04:34:35.626220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4c4cdab6-ed69-4b9b-b709-d63a0e8e2402","year":2025},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:fcbf337a34b7bd96022aa2726308f2f535f737fe6a32b1e7e6647c6604825695","observation_id":"66db41d6-8c86-4691-ad3c-3ee1fd32cd3b","resolution":{"observed_at":"2026-05-22T04:34:35.605142Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.00652","last_updated":"2017-05-01T18:24:15Z","snapshot_observed_at":"2026-07-06T05:40:07.126075Z","submitted_at":"2017-05-01T18:24:15Z","title":"Efficient Natural Language Response Suggestion for Smart Reply","version":1},"cited_work":{"arxiv_id":"1705.00652","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.00652","snapshot_observed_at":"2026-07-03T15:08:33.565390Z","title":"Efficient Natural Language Response Suggestion for Smart Reply","venue":"cs.CL","work_id":"9f8a8448-f960-4197-998c-66af83685561","year":2017},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"cited_paper":"/paper/1705.00652","citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:8c09f5f5ca9db723b98b1e7130075271820a36599c8424ed05fe24eb47ef054f","observation_id":"eb953378-fc18-47b5-8b12-7f38a1f3a1ff","resolution":{"observed_at":"2026-05-22T04:34:35.312490Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06939","last_updated":"2016-03-29T14:52:58Z","snapshot_observed_at":"2026-07-31T19:00:00.136727Z","submitted_at":"2015-11-21T23:42:59Z","title":"Session-based Recommendations with Recurrent Neural Networks","version":4},"cited_work":{"arxiv_id":"1511.06939","doi":"10.48550/arxiv.1511.06939","metadata_source":"pith","pith_arxiv_id":"1511.06939","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Session-based Recommendations with Recurrent Neural Networks","venue":"cs.LG","work_id":"9d4b6587-2e21-4e80-9580-2f993ff7903f","year":2015},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"cited_paper":"/paper/1511.06939","citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:2cf3d7f171243e4da29d975c8bbef0ca2675ac29209df821181d1fe6fdd228b7","observation_id":"a36c88bf-eaed-48ab-b7b4-2dbf57488ca0","resolution":{"observed_at":"2026-05-22T04:34:35.330626Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.17406","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T20:57:23.005172Z","title":"Robust an- swers, fragile logic: Probing the decoupling hypothesis in LLM reasoning","venue":null,"work_id":"79c527b2-2910-4fcf-a9de-428e9b2d7c84","year":2025},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:f669b4abf3849b332bab63c977820b5128b5f542ac0d640a0f1d6d7fafd38413","observation_id":"2659d829-7f28-4399-800b-dd48ea88e6e3","resolution":{"observed_at":"2026-05-22T04:34:35.321646Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"15027bfd-85a2-45f0-8e03-8685baa60089","year":2018},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:d225e88e6dab3b0dcce12a0d854a5d36c61d57da6a97573196f1ba3895f6da0a","observation_id":"2fa2599a-faac-4b51-b28d-2e89a9f98ff6","resolution":{"observed_at":"2026-05-22T04:34:35.613394Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5fd00445-dd6f-4cb9-97a3-3bb05145e12b","year":2014},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:e3ab0305de283793593944399351f4bda84bb1035a4caea85893fed1c3c88386","observation_id":"8068571f-be73-4389-b2b7-98753addfac2","resolution":{"observed_at":"2026-05-22T04:34:35.579825Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.13147","last_updated":"2024-02-08T03:21:26Z","snapshot_observed_at":"2026-07-06T13:14:06.120131Z","submitted_at":"2022-05-26T04:33:56Z","title":"Matryoshka Representation Learning","version":4},"cited_work":{"arxiv_id":"2205.13147","doi":"10.48550/arxiv.2205.13147","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.13147","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Chankyu Lee, Rajarshi Roy, Mengyao Xu, Jonathan Raiman, Mohammad Shoeybi, Bryan Catanzaro, and Wei Ping","venue":null,"work_id":"c625db53-88b0-47bb-b5b6-bea56457525e","year":2022},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"cited_paper":"/paper/2205.13147","citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:d92bc1217d72510ddf3b9e2c829828aa353f97e042fc3d2c5918048bc7be753f","observation_id":"a71ae4da-ef27-490b-8b5e-5c0f728ace8c","resolution":{"observed_at":"2026-05-22T04:34:35.334737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"78c4470f-d7a0-4b06-a6aa-5ff7fb267cda","year":2015},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:27eeaf78fc696243c004246c8f160ef1252aea3b351d5dca3f0b745588324649","observation_id":"e560c52d-3dbd-4309-8453-02eeca58a23b","resolution":{"observed_at":"2026-05-22T04:34:35.610232Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07237","last_updated":"2025-07-25T08:26:13Z","snapshot_observed_at":"2026-07-06T19:13:42.074230Z","submitted_at":"2024-09-11T12:48:52Z","title":"Negative Sampling in Recommendation: A Survey and Future Directions","version":2},"cited_work":{"arxiv_id":"2409.07237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.07237","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Negative sampling in recommendation: A survey and future directions","venue":null,"work_id":"c7e4ae35-8db0-4742-9075-ac8c30330e04","year":2024},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"cited_paper":"/paper/2409.07237","citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:44441e4bb63ad00aa88a162bc693aa71abae801404ecc2cf6979e51ebcd549ad","observation_id":"29a0c014-2ac9-41fe-a2fd-2fc99007a334","resolution":{"observed_at":"2026-05-22T04:34:35.270610Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"629cc1c9-4bd6-44c1-8e9d-84720f659ebf","year":2023},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:3e0e5ee935336870ae463a4ec6e1db2683e0df6e4885e59c2adfda11e0e7c828","observation_id":"4de7736d-e55f-4b0a-99c9-23f10ffb1615","resolution":{"observed_at":"2026-05-22T04:34:35.619806Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06196","last_updated":"2025-03-23T14:51:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-09T05:37:09Z","title":"Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":"2402.06196","doi":"10.48550/arxiv.2402.06196","metadata_source":"pith","pith_arxiv_id":"2402.06196","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Large Language Models: A Survey","venue":"cs.CL","work_id":"54e385fe-1786-48c3-8aa0-d727210eb50e","year":2024},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"cited_paper":"/paper/2402.06196","citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:d3216fd2c7b819c345ea42624ab97b203677c46ed6b34a9023e99c77d5909bef","observation_id":"38491342-bdbd-4ec5-b7cd-a11b5d6d6862","resolution":{"observed_at":"2026-05-22T04:34:35.303437Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"06a80354-b837-4893-a11c-f75eff8a7f0c","year":2026},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:c4fd06bafb1ba97b31d411b8167bdb5587d5923a325f176e35c369146e063977","observation_id":"68adb89a-32dd-45a2-979e-01430f224b7e","resolution":{"observed_at":"2026-05-22T04:34:35.610516Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:03:30.476635Z","title":null,"venue":null,"work_id":"e9b6943b-19d5-43a9-b526-3915d3006305","year":2020},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:6d0fa5be34bf160a62fe71025258a9e19e83d6263476798a84cc99edc35b24cd","observation_id":"aca46138-c3d3-4fd5-961c-80b292526e87","resolution":{"observed_at":"2026-05-22T04:34:35.607134Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"196da395-8fe7-4f2e-84d2-e73f81c55fa7","year":2023},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:8c8f06c146ca536c8c8cb597aa9857d13877d2e085eee90599fda182bc903c4a","observation_id":"155ca587-6ddc-430f-98cf-ed38594c2518","resolution":{"observed_at":"2026-05-22T04:34:35.628940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":"1908.10084","doi":"10.48550/arxiv.1908.10084","metadata_source":"pith","pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-07-10T20:57:34.817516Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","venue":"cs.CL","work_id":"27adfcc9-2a67-43d6-a844-78309012411f","year":2019},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:363cb5b8b9860a078eaaeed8b9dcd4ae8be71692579d94740862c5934205793f","observation_id":"90c7103b-4535-4d6a-87b9-04d1f60b08c2","resolution":{"observed_at":"2026-05-22T04:34:35.302886Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-12T06:19:15.148899+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T06:19:15.148899+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:3e2d9616c7b8de5a8505e4c6843a9fb1c2df76cc907067fb5b0efdcd29befac4","observation_id":"8c929808-e972-4543-9ba4-cb94893a9c7e","resolution":{"observed_at":"2026-05-22T04:34:35.292332Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"39c6cb11-f8ed-4c18-86cc-5dc8c021fca2","year":2017},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:a191a657c543dd531e38fb81b38ea8539e25684f04fe713f558707dbe6288d64","observation_id":"826cace2-7c79-463f-9b75-2ab0d318fffb","resolution":{"observed_at":"2026-05-22T04:34:35.613128Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.12211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tan, J., Chen, Y ., Zhang, A., Jiang, J., Liu, B., Xu, Z., Han, Z., Xu, J., Zheng, B., and Wang, X","venue":null,"work_id":"99e2993c-cb9e-4f89-bd0b-454001022cf0","year":2025},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:15250a724c2f30e1b44b9978ad766b144a952be3556ac8ca1b28bcbac3480698","observation_id":"5ea01efc-5219-4958-ab84-7e729d27be15","resolution":{"observed_at":"2026-05-22T04:34:35.297970Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0c5d27ad-9b61-4cec-ba4f-5737a9e14139","year":2018},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:14706d891adbd288e9549d017f42b81d59795cf8d4b5146af2fd9fe39a698892","observation_id":"d6919245-19b2-4eb5-bc18-c96a3a34c397","resolution":{"observed_at":"2026-05-22T04:34:35.623201Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:0acb0164b2ed7a8ceaf6b7663408eaa9b4488867d808ba62bf6944724b7df0ff","observation_id":"a542b79f-0794-449b-9830-106597d3e4fb","resolution":{"observed_at":"2026-05-22T04:34:35.340287Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13160","last_updated":"2023-10-10T17:34:15Z","snapshot_observed_at":"2026-07-06T15:30:45.921201Z","submitted_at":"2023-05-22T15:47:31Z","title":"Can ChatGPT Defend its Belief in Truth? Evaluating LLM Reasoning via Debate","version":2},"cited_work":{"arxiv_id":"2305.13160","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13160","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can chatgpt defend the truth? automatic dialectical evaluation elicits llms' deficiencies in reasoning","venue":null,"work_id":"fb2537f0-f705-4d89-942b-41ebb411806a","year":2023},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"cited_paper":"/paper/2305.13160","citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:3529ae2a7d933b407e5b1913c70ae5d711b0386a1c11b25e833339c2f72482aa","observation_id":"a5b41146-aca3-4a49-9d22-b267c1e72740","resolution":{"observed_at":"2026-05-22T04:34:35.313310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2506.01939","doi":"10.48550/arxiv.2506.01939","metadata_source":"pith","pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","venue":"cs.CL","work_id":"e5e936f3-0cff-4732-b394-f607d7a63f5f","year":2025},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:2ef36c9cef810905b65ad61b7a4cf2003d0b427e0f347be3b135cd9dd746b0f4","observation_id":"78498029-6139-4bda-bcb5-ee393b995962","resolution":{"observed_at":"2026-05-22T04:34:35.331165Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:08.024018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:08.024018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a5f1534e-db13-4300-a840-466946418533","year":2024},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:430a41cac2feaea209a9ad5a9e4b094d9e3eebf69b96889d3565bb11ba8d5f34","observation_id":"76f3fad4-d774-49aa-9fb6-b623dc151575","resolution":{"observed_at":"2026-05-22T04:34:35.590852Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"63d1fde1-1fe7-4f61-96c6-07c5169b6626","year":null},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:a4f7e1e7072ceaab0bf7edcf05aab4b1db1c83812e193b6f05179d18c2c41baa","observation_id":"97a94677-bf49-4a83-ab85-1eb4da7538b4","resolution":{"observed_at":"2026-05-22T04:34:35.587153Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"InThe Thirty-ninth Annual Conference on Neural Information Processing Systems","venue":null,"work_id":"db9a0e18-e217-4ff0-a06a-66f34ac733ad","year":null},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:1c0c13ef075021ef150664d7bbd4cc03c60368770dae80354ac8a2d5ebeefc35","observation_id":"cb9139e4-79cf-4715-bf7f-19cb79028ab3","resolution":{"observed_at":"2026-05-22T04:34:35.597472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5c21343e-fe6e-45cb-bbfa-7f3a83785f79","year":2025},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:b40df52b3b9b0a5b342af0d2c503c954e30041a73423f9e65d5b9d538dadaa16","observation_id":"85c38152-423f-4c36-be77-ef95c20e66a4","resolution":{"observed_at":"2026-05-22T04:34:35.602173Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.19092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:29:42.012883Z","title":"arXiv preprint arXiv:2505.19092 (2025)","venue":null,"work_id":"6fd215fb-8977-4afc-8c6c-cab80ca6b376","year":2025},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:61f0395008664d79b96932ccd40f510dfb53534ff2aaeacbe6fe188339992452","observation_id":"b346361c-fef2-41cf-a97c-79e95925b47a","resolution":{"observed_at":"2026-05-22T04:34:35.317052Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":"2303.18223","doi":"10.18653/v1/d16-1080","metadata_source":"pith","pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"A Survey of Large Language Models","venue":"cs.CL","work_id":"de1b42b5-4a0a-4b1f-8c78-1f7fe21be6c9","year":2023},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:3edf8657495f67d0e5822d66c14b07b71ce92be3735b8426b3a48af4771a19f3","observation_id":"46ce351f-fc9a-4637-bcbd-71553d42bd4a","resolution":{"observed_at":"2026-05-22T04:34:35.326114Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f448823e-2592-4587-ba67-41260455327f","year":2019},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:fa02a40fe10b49bfeb9face11d09bc7d1b5d706eb3cef1042b1c482b0a4c838b","observation_id":"92b5a338-b141-44c4-8a12-15f2d5fea5e2","resolution":{"observed_at":"2026-05-22T04:34:35.631870Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4d16aac1-a7c7-4f5b-b19b-44111537f41e","year":null},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:317374ac6da859a2de8e2a0d2f194ffef2f4c6aaad4601f1ff426b76ec629bdd","observation_id":"103e6b65-dfc0-48a7-9cfd-2afcbcd7790c","resolution":{"observed_at":"2026-05-22T04:34:35.624459Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"decision tokens","venue":null,"work_id":"c242f217-e859-411b-8265-46b78357a732","year":2023},"citing_paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-22T04:34:28.214871Z"},"links":{"citing_paper":"/paper/2605.21967"},"observation_digest":"sha256:589927a886a87beee9365a3c6f3d29fdbf673fb2d418985e389f456b553b10fb","observation_id":"27ac8ec3-dbf5-4872-8332-31da2843c194","resolution":{"observed_at":"2026-05-22T04:34:35.599533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.21967","last_updated":"2026-05-21T03:56:42Z","latest_version":1,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-01T14:47:03.831108Z","submitted_at":"2026-05-21T03:56:42Z","title":"Reinforced Preference Optimization for Reasoning-Augmented Recommendations"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":16,"verified_fuzzy":4},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2605.21967."}