{"as_of":"2026-08-07T19:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d6adc07d32c7a7cd169e01d8b807d4ca72600e45a9f4a074d5a0de919086f672","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:49:05.708180Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T01:49:15.136031Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T16:01:22.618150Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-06T08:44:22.163891Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2508.04848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.04848","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4afc3aec-f8e3-4de7-b3bf-6a59cd510832","year":2025},"citing_paper":{"arxiv_id":"2605.00814","last_updated":"2026-05-08T16:52:48Z","snapshot_observed_at":"2026-07-06T23:14:11.211164Z","submitted_at":"2026-05-01T17:54:37Z","title":"Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-09T18:53:06.494640Z"},"links":{"cited_paper":"/paper/2508.04848","citing_paper":"/paper/2605.00814"},"observation_digest":"sha256:6527f06fda8dd43b653c1f8cc097b1f78bdb2748910cf51260422d2cf19c7606","observation_id":"b426df3d-129f-4e23-a706-9cb26d330ce0","resolution":{"observed_at":"2026-05-11T16:01:22.621931Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-06T08:44:22.163891Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2508.04848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.04848","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4afc3aec-f8e3-4de7-b3bf-6a59cd510832","year":2025},"citing_paper":{"arxiv_id":"2605.00814","last_updated":"2026-05-08T16:52:48Z","snapshot_observed_at":"2026-07-06T23:14:11.211164Z","submitted_at":"2026-05-01T17:54:37Z","title":"Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-11T01:49:15.136031Z"},"links":{"cited_paper":"/paper/2508.04848","citing_paper":"/paper/2605.00814"},"observation_digest":"sha256:a7e0332a2c277dc3b42344d4f8e63dbbf0dbda8e4cd1774330487d20d1f349a2","observation_id":"b60805a6-808a-4981-b738-8bea31069308","resolution":{"observed_at":"2026-05-11T01:50:51.662264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.04848/citation-record","integrity":"/paper/2508.04848/integrity","json":"/paper/2508.04848/citation-record.json","paper":"/paper/2508.04848"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00742","last_updated":"2025-07-01T13:46:00Z","snapshot_observed_at":"2026-08-07T04:43:41.766479Z","submitted_at":"2025-07-01T13:46:00Z","title":"Evaluating LLMs and Prompting Strategies for Automated Hardware Diagnosis from Textual User-Reports","version":1},"cited_work":{"arxiv_id":"2507.00742","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.00742","snapshot_observed_at":"2026-08-05T23:49:07.405031Z","title":"Evaluating LLMs and Prompting Strategies for Automated Hardware Diagnosis from Textual User-Reports","venue":"cs.LG","work_id":"4fdbfc06-a91d-4b02-8b8b-ed8c4590b0dd","year":2025},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-06T08:44:22.163891Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:02.285130Z"},"links":{"cited_paper":"/paper/2507.00742","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:016c8265b2cadef0425210be8d12b745f7200bccfe442f013826e96f1d2c2e17","observation_id":"4cd5b0c6-2b61-4a8b-802e-9cd4f7868183","resolution":{"observed_at":"2026-08-05T23:49:07.511703Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:49:07.674149Z","title":null,"venue":null,"work_id":"07400121-d4d0-4c80-bbc6-ec6871d0bac1","year":2024},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-06T08:44:22.163891Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:02.550966Z"},"links":{"citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:650197dd27359a2b87f97ad023d9b07efedd1c724dc76c72f626056d60bd52f7","observation_id":"26e2ce09-01a4-4690-ac40-280bd2d77a25","resolution":{"observed_at":"2026-08-05T23:49:07.820130Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:49:02.715209Z","title":"arXiv preprint arXiv:2503.12434","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-06T08:44:22.163891Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:02.715209Z"},"links":{"citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:6c782ae1569c52012fc75fdbe757d47a53f93484aa064f0fb28c25361b25ef5c","observation_id":"3a6443b6-1c35-4fb7-a39b-93fcaba8ab0b","resolution":{"observed_at":"2026-08-05T23:49:02.715209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T23:49:02.929694Z","title":"arXiv preprint arXiv:2501.12948","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-06T08:44:22.163891Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:02.929694Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:e4be82e68bfbc12efa0777091ce5089038d6bd74d0b5f85a9b88a1042306e01e","observation_id":"cc53431a-943a-4af7-afb6-ffb268577a7a","resolution":{"observed_at":"2026-08-05T23:49:02.929694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-05T20:06:13.107818Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-05T23:49:03.216906Z","title":"arXiv preprint arXiv:2410.01679","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-06T08:44:22.163891Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:03.216906Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:579d8d9681f5b30f4c4cb1425e27da5e5b2cff46fafcdd9eb384f14825a852ec","observation_id":"eed7fb36-b81f-4e42-afde-45576bac2ccc","resolution":{"observed_at":"2026-08-05T23:49:03.216906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21321","last_updated":"2025-03-24T09:34:38Z","snapshot_observed_at":"2026-08-07T17:38:55.347235Z","submitted_at":"2025-02-28T18:59:54Z","title":"LLM Post-Training: A Deep Dive into Reasoning Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21321","snapshot_observed_at":"2026-08-05T23:49:03.474747Z","title":"arXiv preprint arXiv:2502.21321","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-06T08:44:22.163891Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:03.474747Z"},"links":{"cited_paper":"/paper/2502.21321","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:5b015ee0c4bc73d7c3697aa645fd56ff3add269cc9f8a2cfac9f01c3a135f35b","observation_id":"c089ee1b-f9ea-4421-8d1d-ce90170f4779","resolution":{"observed_at":"2026-08-05T23:49:03.474747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T23:49:04.041085Z","title":"arXiv preprint arXiv:2402.03300","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-06T08:44:22.163891Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:04.041085Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:9d34a5c270bc8a04cdf191fe5444691231154a0efc705924032bf6f73456f495","observation_id":"5069f2cf-b853-4e39-a927-395baf2b1c31","resolution":{"observed_at":"2026-08-05T23:49:04.041085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00612","last_updated":"2025-09-05T16:00:06Z","snapshot_observed_at":"2026-08-06T08:44:51.604766Z","submitted_at":"2025-02-02T00:36:40Z","title":"Using Causality for Enhanced Prediction of Web Traffic Time Series","version":2},"cited_work":{"arxiv_id":"2502.00612","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.00612","snapshot_observed_at":"2026-08-05T23:49:06.581628Z","title":"Using Causality for Enhanced Prediction of Web Traffic Time Series","venue":"cs.LG","work_id":"0cb640b2-c13a-4d36-b517-d747c0b20cd8","year":2025},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-06T08:44:22.163891Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:04.374494Z"},"links":{"cited_paper":"/paper/2502.00612","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:11ca8b986ac9a3fd66c6a7b4244ca7515431ec56b6034e40496c136493e6fb8c","observation_id":"2a099c1a-ee77-4545-bebb-118df17d7438","resolution":{"observed_at":"2026-08-05T23:49:06.723730Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18548","last_updated":"2025-03-13T16:48:34Z","snapshot_observed_at":"2026-08-07T17:49:46.596474Z","submitted_at":"2025-02-25T15:56:56Z","title":"What is the Alignment Objective of GRPO?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18548","snapshot_observed_at":"2026-08-05T23:49:04.813342Z","title":"Wang, K.; Pan, J.; Shi, W.; Lu, Z.; Ren, H.; Zhou, A.; Zhan, M.; and Li, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-06T08:44:22.163891Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:04.813342Z"},"links":{"cited_paper":"/paper/2502.18548","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:140a7ecfd19bb1eda2c49bd6ee047ddf18dab1190029971d378ec3dfad66c2a0","observation_id":"9453a80a-4f89-45ac-adb3-85b33cfdf8d6","resolution":{"observed_at":"2026-08-05T23:49:04.813342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00451","last_updated":"2024-06-17T22:11:49Z","snapshot_observed_at":"2026-07-06T18:08:09.361079Z","submitted_at":"2024-05-01T11:10:24Z","title":"Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00451","snapshot_observed_at":"2026-08-05T23:49:05.025670Z","title":"arXiv preprint arXiv:2405.00451","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-06T08:44:22.163891Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:05.025670Z"},"links":{"cited_paper":"/paper/2405.00451","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:c34407c7291ed6499626263376267e95d51f198f860d4de7eb60636f9eb0d7a0","observation_id":"da8eb2be-757c-408d-9572-55982b3900b1","resolution":{"observed_at":"2026-08-05T23:49:05.025670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18587","last_updated":"2025-04-24T01:31:05Z","snapshot_observed_at":"2026-08-07T15:59:41.578088Z","submitted_at":"2025-04-24T01:31:05Z","title":"Training Large Language Models to Reason via EM Policy Gradient","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18587","snapshot_observed_at":"2026-08-05T23:49:05.199743Z","title":"arXiv preprint arXiv:2504.18587","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-06T08:44:22.163891Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:05.199743Z"},"links":{"cited_paper":"/paper/2504.18587","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:562cd2ca59937fdd72a82ad8bdf2a4d4e427658cfc4eef838ca81db09c8c8183","observation_id":"4dd15b6d-ed00-430b-b9bf-739dc07bb09e","resolution":{"observed_at":"2026-08-05T23:49:05.199743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T23:49:05.395955Z","title":"arXiv preprint arXiv:2503.14476","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-06T08:44:22.163891Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:05.395955Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:3c6f28c705578659386fb9a7a524bbf98c250b0d45ab816cd37aa89a168288f3","observation_id":"b51dbaea-cabf-458e-bd33-21a885642e6d","resolution":{"observed_at":"2026-08-05T23:49:05.395955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:49:05.541952Z","title":"arXiv preprint arXiv:2505.17508","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-06T08:44:22.163891Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:05.541952Z"},"links":{"citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:219e26fded2b29b2315e5b1b21a8b5befbfbaa5e31361e207f5cfa71f4416c56","observation_id":"8197227e-d83e-46e8-b5bb-5485649366a8","resolution":{"observed_at":"2026-08-05T23:49:05.541952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08603","last_updated":"2025-01-31T05:28:15Z","snapshot_observed_at":"2026-07-06T20:21:13.914417Z","submitted_at":"2025-01-15T06:00:50Z","title":"Monte Carlo Tree Search for Comprehensive Exploration in LLM-Based Automatic Heuristic Design","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08603","snapshot_observed_at":"2026-08-05T23:49:05.708180Z","title":"arXiv preprint arXiv:2501.08603","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-06T08:44:22.163891Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:05.708180Z"},"links":{"cited_paper":"/paper/2501.08603","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:b1cf5a7ee06039b62226adc99fb016c14c037974521ddbdb7c6a35e0c8ab7431","observation_id":"8a413b4d-c7e9-4a91-b607-8b6cf0a66171","resolution":{"observed_at":"2026-08-05T23:49:05.708180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T23:49:03.820612Z","title":"arXiv preprint arXiv:1707.06347","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-06T08:44:22.163891Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:03.820612Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:51bd84e5ad504f56d173758de0d2f3eb1ad8905ccb85bc1c0015f4eea0bdac3c","observation_id":"c5a07c9f-a069-4938-9dbe-c3d61df449e2","resolution":{"observed_at":"2026-08-05T23:49:03.820612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13103","last_updated":"2025-02-06T15:57:23Z","snapshot_observed_at":"2026-07-06T18:33:19.806199Z","submitted_at":"2024-06-18T23:27:46Z","title":"A Generic Method for Fine-grained Category Discovery in Natural Language Texts","version":2},"cited_work":{"arxiv_id":"2406.13103","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.13103","snapshot_observed_at":"2026-08-05T23:49:06.877878Z","title":"A Generic Method for Fine-grained Category Discovery in Natural Language Texts","venue":"cs.AI","work_id":"e68a0da3-a15f-42d0-bb4e-fa590d97df1c","year":2024},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-06T08:44:22.163891Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:04.213823Z"},"links":{"cited_paper":"/paper/2406.13103","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:f70940297cc942b1e325d0ddf2c874f8cc05e954af28cc7099bafd86dd653d1e","observation_id":"e9fbee50-7381-4d9e-9880-7e86a8620486","resolution":{"observed_at":"2026-08-05T23:49:07.013350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T23:49:03.062950Z","title":"arXiv preprint arXiv:2009.03300","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-06T08:44:22.163891Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:03.062950Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:ae9f5c0c34420de324017350ef1ef52de7110f371e765917175bd2e2f4579e0d","observation_id":"10b799cd-fa19-409b-8e5e-13ff2688b4a9","resolution":{"observed_at":"2026-08-05T23:49:03.062950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.11682","last_updated":"2021-09-27T21:14:10Z","snapshot_observed_at":"2026-08-05T08:28:57.985526Z","submitted_at":"2021-09-23T22:57:16Z","title":"Paint4Poem: A Dataset for Artistic Visualization of Classical Chinese Poems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.11682","snapshot_observed_at":"2026-08-05T23:49:03.658162Z","title":"arXiv preprint arXiv:2109.11682","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-06T08:44:22.163891Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:03.658162Z"},"links":{"cited_paper":"/paper/2109.11682","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:8ae94997efba055b890df00d4204fc5f01f4df56dbd9fdb28a8977215f835faa","observation_id":"9fdfde4a-26c7-4548-9b83-561e8375ee4e","resolution":{"observed_at":"2026-08-05T23:49:03.658162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.11762","last_updated":"2024-04-13T11:51:55Z","snapshot_observed_at":"2026-07-06T13:34:41.214521Z","submitted_at":"2022-07-24T15:38:08Z","title":"Anti-Overestimation Dialogue Policy Learning for Task-Completion Dialogue System","version":2},"cited_work":{"arxiv_id":"2207.11762","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.11762","snapshot_observed_at":"2026-08-05T23:49:06.144931Z","title":"Anti-Overestimation Dialogue Policy Learning for Task-Completion Dialogue System","venue":"cs.CL","work_id":"92309fd6-ef02-462e-8b7b-8f444e12759f","year":2022},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-06T08:44:22.163891Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:04.536418Z"},"links":{"cited_paper":"/paper/2207.11762","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:450347988e697320c12360d841f693abae8df9d86dd08da23ec45ba5ab436017","observation_id":"f8585f12-a48c-4d6d-b420-834437982951","resolution":{"observed_at":"2026-08-05T23:49:06.307243Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02472","last_updated":"2024-11-07T18:30:38Z","snapshot_observed_at":"2026-07-06T19:26:58.835479Z","submitted_at":"2024-10-03T13:25:15Z","title":"Meta-Models: An Architecture for Decoding LLM Behaviors Through Interpreted Embeddings and Natural Language","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02472","snapshot_observed_at":"2026-08-05T23:49:02.409134Z","title":"arXiv preprint arXiv:2410.02472","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-06T08:44:22.163891Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:02.409134Z"},"links":{"cited_paper":"/paper/2410.02472","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:ac799fcef3a9624f2bdc690173bf58fd5b932005d589e6973b3088281d5b34c5","observation_id":"22c06452-16ca-4c32-b0ab-d55ec42d5471","resolution":{"observed_at":"2026-08-05T23:49:02.409134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T23:49:02.173108Z","title":"5-vl technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-06T08:44:22.163891Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:02.173108Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:d66157f9864c744ff296d48475354ee330367ca3ab4db569c84c7b43dd35e8c2","observation_id":"6c9329a9-57f5-468f-aeec-0c66a4b91d01","resolution":{"observed_at":"2026-08-05T23:49:02.173108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T08:44:22.163891Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 2 inbound Pith citation observations for arXiv:2508.04848."}