{"as_of":"2026-07-22T10:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3a6b3cecfe46f094c33922b7c879a0702cccdc555fd41948cb379d0af485eb47","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T18:44:14.878564Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-22T06:31:00.163083+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.24005/citation-record","integrity":"/paper/2605.24005/integrity","json":"/paper/2605.24005/citation-record.json","paper":"/paper/2605.24005"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.02814","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T18:45:00.033689Z","title":null,"venue":null,"work_id":"1fa14b04-8aa7-46b7-8a54-69db28aadd2a","year":2026},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:3bcb880532a3e2598338604b096b9f8665ce768f54c63f1fe4ba6720e42341f8","observation_id":"54c0164e-3120-4dc2-a527-fd289355c90f","resolution":{"observed_at":"2026-06-30T18:45:00.035013Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-07-11T03:27:46.202228Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:ef62c188f56e787860365350ff5a9f812063d1971527b214e2c8ad5f7a852d47","observation_id":"60c29349-af84-4344-9289-28e00b196ff4","resolution":{"observed_at":"2026-06-30T18:45:00.046721Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-11T10:18:59.594684+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T10:18:59.594684+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":"2503.09567","doi":"10.48550/arxiv.2503.09567","metadata_source":"pith","pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-07-10T18:57:31.639044Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","venue":"cs.AI","work_id":"0b361fed-cf2a-4b90-b61a-de88de4b8840","year":2025},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:30e21ab5897a88a9e17ed5666fef84a92eef724b719b132a0f61d33e02a2856d","observation_id":"121077fe-ecdc-4b28-84da-61e1cd4c570f","resolution":{"observed_at":"2026-06-30T18:45:00.063705Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-05-25T19:23:19.477611+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T19:23:19.477611+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:14:30.509181Z","title":null,"venue":null,"work_id":"1bcc53c3-a8d4-4bd1-bf1b-3cbeb77d41f9","year":2026},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:12795afce8a3dcb6e530600aaf24c58ba529019b49e0d878ca0e84e08d44df9c","observation_id":"1c0c37b9-4e42-4d9a-9e67-8688970cc862","resolution":{"observed_at":"2026-07-08T03:14:30.510428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:24:29.235564Z","title":null,"venue":null,"work_id":"6d39783e-b460-4ac7-9166-c24537f53822","year":2021},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:7f857ef8e1a514f894d2449427167facb8feee052435b335266aa9472899fad6","observation_id":"b4337246-8a6f-4364-b91c-3c0a3dd29cd4","resolution":{"observed_at":"2026-07-08T03:24:29.236691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-07-06T16:35:40.224690Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":"2310.12773","doi":"10.48550/arxiv.2310.12773","metadata_source":"pith","pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","venue":"cs.AI","work_id":"45bf2da5-62a0-441e-b0fc-77d659b681db","year":2023},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:15ad0050debce8d97ed4c039d0caf0ec1fe39a72e581931b6a9a0d99d60ed51e","observation_id":"ebebc27d-edbf-4a22-97e5-1960b281b44e","resolution":{"observed_at":"2026-06-30T18:45:00.011659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.04220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T21:06:34.823682Z","title":"On grpo collapse in search-r1: The lazy likelihood- displacement death spiral","venue":null,"work_id":"ccf2c4a4-1d0c-436f-a160-0001f11cc060","year":2025},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:35c1f9f74c68de5a180793526c07329037ba2ab1a5ce91515143bbc68509625a","observation_id":"f9ee71c3-8b49-4d28-b773-fff90ca58f77","resolution":{"observed_at":"2026-06-30T18:45:00.018673Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:24:29.259668Z","title":null,"venue":null,"work_id":"38c3c7bf-ff37-453e-96be-8d7c1b833748","year":2013},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:2853b81f9846743cd7c6e741db546911141fa5da280fce71ac72fcb949674e87","observation_id":"4d0e2bf4-2fe1-4361-b081-6178d1ae37a8","resolution":{"observed_at":"2026-07-08T03:24:29.261341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06257","last_updated":"2022-05-05T17:01:45Z","snapshot_observed_at":"2026-07-06T10:48:42.637397Z","submitted_at":"2021-03-10T18:45:48Z","title":"Maximum Entropy RL (Provably) Solves Some Robust RL Problems","version":2},"cited_work":{"arxiv_id":"2103.06257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.06257","snapshot_observed_at":"2026-07-01T20:46:14.370062Z","title":"Maximum entropy RL (provably) solves some robust RL problems","venue":null,"work_id":"24018614-8b61-4673-9779-d8329016872c","year":2021},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"cited_paper":"/paper/2103.06257","citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:e0954d6fd86446307350116d11d082a01297b5780e71ee95a3d2940b5137ecaf","observation_id":"247da142-9fa0-4733-9d82-fb746e4928b3","resolution":{"observed_at":"2026-06-30T18:45:00.059456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:24:29.246720Z","title":null,"venue":null,"work_id":"5a589192-e995-4e19-907a-cb04662154f5","year":2024},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:294da3815e2c3ddac08576f95f7cec244087f8e2a412a1e0df2ceb751e0bb554","observation_id":"78572340-b137-45d1-9e4e-71bc17902869","resolution":{"observed_at":"2026-07-08T03:24:29.247911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:14:32.366678Z","title":null,"venue":null,"work_id":"c45b3e15-6c96-4299-a0ae-9930eea7f44e","year":2013},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:dbe1836b01ee8dc1aef88711836c8387262732261fe5d4395b03c46c8148a57c","observation_id":"c4da97ba-6227-4fea-9d2b-7e3b3299ddb7","resolution":{"observed_at":"2026-07-08T03:14:32.368123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:14:32.369825Z","title":null,"venue":null,"work_id":"f8d99d54-7fa7-4fa3-8270-2f2c010fbcac","year":2022},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:2c52d67a37838d52d1ddd4a7dd6727f63a56cd4cc0c7892fc63b3e35f37ae1c1","observation_id":"b3eba1e4-e84a-4940-b249-03e3a7626e9c","resolution":{"observed_at":"2026-07-08T03:14:32.371200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.22047","doi":"10.48550/arxiv.2509.22047","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MO-GRPO: Mitigating reward hacking of group relative policy optimization on multi-objective problems","venue":null,"work_id":"1490483b-6878-4e15-9bc3-8673448d53e7","year":2025},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:5ebea95ff6cb94083c265afe4c9c92e4110696de28a39bc8462ec1acf5badc25","observation_id":"7406bf45-c10e-4699-a55d-e05fd9c9b6e3","resolution":{"observed_at":"2026-06-30T18:45:00.014879Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05068","last_updated":"2021-06-09T13:44:06Z","snapshot_observed_at":"2026-07-06T11:17:34.454271Z","submitted_at":"2021-06-09T13:44:06Z","title":"Offline Inverse Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2106.05068","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.05068","snapshot_observed_at":"2026-06-30T18:45:00.025477Z","title":null,"venue":null,"work_id":"96f5ff90-2bc4-47aa-8585-c745bec3944c","year":2021},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"cited_paper":"/paper/2106.05068","citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:8be545e0aecc6f78f0beb56d3ed29b190192e9524bc77d79bb5c9d1a5e497364","observation_id":"9a4cdea3-b2e8-42ed-b0b0-668e5d33ce55","resolution":{"observed_at":"2026-06-30T18:45:00.029506Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:14:32.374149Z","title":null,"venue":null,"work_id":"3859a05f-058a-48ab-a2b1-f4c963d5880a","year":1982},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:fb83819c9fc3d7250ccb23565cc1ac8256e453a0381195283a080d850792673e","observation_id":"7ecf704b-606e-4ff0-9686-1f1250844163","resolution":{"observed_at":"2026-07-08T03:14:32.375664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:24:29.221143Z","title":null,"venue":null,"work_id":"a6a8fe4f-53eb-459e-aaf1-47f737b7357f","year":2026},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:9a3b9295a3e2ad75cee329622931f1d301f8fabc543361ba70516ba334e6c99b","observation_id":"8c47136b-1a61-493f-91c6-944c463ab62b","resolution":{"observed_at":"2026-07-08T03:24:29.222524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:24:29.239192Z","title":null,"venue":null,"work_id":"23d69ade-b750-479b-bfc9-4252805bdcab","year":2025},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:9268ab55f0330c05a254336e931ef2253f41414ce2219a1c8e30167e0f08abc5","observation_id":"18adc8fe-7992-444e-a0a0-694a07b0542d","resolution":{"observed_at":"2026-07-08T03:24:29.240434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:24:29.257436Z","title":null,"venue":null,"work_id":"0e2ac706-9074-4290-bfa1-4df54897bae7","year":null},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:d05541250f8be0e2d4de40228a843f8e2df879fec8e46ebbc8468c2ef4c37943","observation_id":"ccbc4776-07e9-4ecc-b144-7ab37a748401","resolution":{"observed_at":"2026-07-08T03:24:29.258872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.04559","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T18:45:00.065270Z","title":"Diffu- sion fine-tuning via reparameterized policy gradient of the soft q-function.arXiv preprint arXiv:2512.04559, 2025","venue":null,"work_id":"b7ecdc50-bda7-48af-858a-d56857a534fe","year":2025},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:b2748ca68d72f43b8ecf1143271fbdfe6629b43f199f93a2f1a3a537e74138e9","observation_id":"84ac4e96-9220-41fc-a390-ef9088a45ae4","resolution":{"observed_at":"2026-06-30T18:45:00.067774Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00889","last_updated":"2020-04-22T20:19:19Z","snapshot_observed_at":"2026-07-06T07:57:32.030864Z","submitted_at":"2019-06-03T15:48:38Z","title":"Learning to solve the credit assignment problem","version":4},"cited_work":{"arxiv_id":"1906.00889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1906.00889","snapshot_observed_at":"2026-06-30T18:45:00.036224Z","title":"J., Prakash, P","venue":null,"work_id":"2b742f3d-402b-41c8-9f90-7713eb6c0947","year":2019},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"cited_paper":"/paper/1906.00889","citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:729568e568f12417e515892381241fb8e145ae625a97d9b73cf8df88c575bf2a","observation_id":"2b711512-2679-4cfb-8dc1-869bc791bd02","resolution":{"observed_at":"2026-06-30T18:45:00.040459Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21819","last_updated":"2025-03-26T05:50:33Z","snapshot_observed_at":"2026-07-06T20:59:54.016142Z","submitted_at":"2025-03-26T05:50:33Z","title":"Optimizing Safe and Aligned Language Generation: A Multi-Objective GRPO Approach","version":1},"cited_work":{"arxiv_id":"2503.21819","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.21819","snapshot_observed_at":"2026-06-30T18:45:00.041828Z","title":"Optimizing safe and aligned language generation: A multi-objective GRPO approach","venue":null,"work_id":"57009f46-7f69-4969-8f14-f7bdd53748dd","year":2025},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"cited_paper":"/paper/2503.21819","citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:9aed7b45219e2879887a7f645cf566e85ecd55c678ee986e52ee8dae95db2f75","observation_id":"87680c98-70d7-4072-bfee-866ddb0f1ad5","resolution":{"observed_at":"2026-06-30T18:45:00.043582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23235","last_updated":"2025-06-29T13:45:54Z","snapshot_observed_at":"2026-07-06T21:49:18.028734Z","submitted_at":"2025-06-29T13:45:54Z","title":"Generalist Reward Models: Found Inside Large Language Models","version":1},"cited_work":{"arxiv_id":"2506.23235","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23235","snapshot_observed_at":"2026-07-02T23:07:27.285466Z","title":"arXiv preprint arXiv:2506.23235 , year=","venue":null,"work_id":"c6fbb042-2b4a-4efd-9bcb-d869857c1b5c","year":2025},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"cited_paper":"/paper/2506.23235","citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:f10b29a278f8aefa3f9f55c4d410919a61e4c9c457fbdb6872aa446304046cd1","observation_id":"c745f4bf-2eaa-4d89-b69b-d9221306ed03","resolution":{"observed_at":"2026-06-30T18:45:00.055756Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:24:29.241250Z","title":null,"venue":null,"work_id":"54f39840-3704-4221-85ac-53ff109310c8","year":2023},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:85fc94594bdeb7774449dbbc076a7f0a00836d820295d84b8e716468330f2db9","observation_id":"855317ae-5e44-4424-911d-a51598c602d8","resolution":{"observed_at":"2026-07-08T03:24:29.242458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14239","last_updated":"2025-04-19T09:25:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-19T09:25:55Z","title":"InfiGUI-R1: Advancing Multimodal GUI Agents from Reactive Actors to Deliberative Reasoners","version":1},"cited_work":{"arxiv_id":"2504.14239","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.14239","snapshot_observed_at":"2026-07-09T18:26:26.304911Z","title":"InfiGUI-R1: Advancing Multimodal GUI Agents from Reactive Actors to Deliberative Reasoners","venue":"cs.AI","work_id":"a7d6f6c7-8a57-4a83-9c4e-892cdc190280","year":2025},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"cited_paper":"/paper/2504.14239","citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:36a6456200d20e6afeddc20e76b3260e2fdf603abb05541f9fc84696a352748b","observation_id":"d2671c0d-bd3e-4f77-ac3b-72a0b333ebc6","resolution":{"observed_at":"2026-06-30T18:45:00.003229Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.11653","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T12:58:08.769761Z","title":"Math-beyond: A benchmark for rl to expand beyond the base model, 2025.https://arxiv.org/abs/2510.11653","venue":null,"work_id":"03aabf80-16ee-412c-a71b-6eb6ad1c27da","year":2025},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:182592b0ee6229e096a8e05e78ca21eb7463ed2569b5fb09ce23bfd18373bc6e","observation_id":"25339bd1-273c-4b19-a49c-955b53d651e7","resolution":{"observed_at":"2026-06-30T18:45:00.052582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:24:29.231291Z","title":null,"venue":null,"work_id":"6f8f8e0b-7fd4-4ba6-8864-64585e196a03","year":2024},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:407688783d14b11c186879a0d3366b1dd8e2e0bf9bafd5a2715f951dbe54dab8","observation_id":"41798343-652a-4159-aef5-a1ee4e65994d","resolution":{"observed_at":"2026-07-08T03:24:29.232856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:24:29.250462Z","title":"Ng and Stuart J","venue":null,"work_id":"6e29477e-bbe7-4886-94b7-1931be31f815","year":2000},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:c258ae6d0891948b5a27d8592e9ccb457aef52b6557c324c869c668ea0bd54b8","observation_id":"a541ca8a-5344-4e41-8fa3-860c9d3a05be","resolution":{"observed_at":"2026-07-08T03:24:29.251781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.02833","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T01:36:25.638921Z","title":"arXiv preprint arXiv:2508.02833 , year=","venue":null,"work_id":"3273d088-9210-421b-85eb-74e5c46e29e7","year":2025},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:80a4a9db67c78aaf34b39e47dac51bcc707a3e6b34c74c6c683b63a54cbf989b","observation_id":"4b9b756d-4823-4bc5-a175-1cc7fa3eadfc","resolution":{"observed_at":"2026-06-30T18:45:00.049458Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01072","last_updated":"2024-07-04T09:32:18Z","snapshot_observed_at":"2026-07-06T16:56:01.826549Z","submitted_at":"2023-12-02T08:49:51Z","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2312.01072","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.01072","snapshot_observed_at":"2026-07-04T17:40:00.280883Z","title":"A survey of temporal credit assignment in deep reinforcement learning","venue":null,"work_id":"974bd811-fce0-4e67-ae9d-697f5f35a1e8","year":2023},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"cited_paper":"/paper/2312.01072","citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:3640064acd68a4d0ce4561a9406a36fda96212bd6b45f9d9f36c748f1c9afc99","observation_id":"53a38aa9-158d-46e4-abea-047a8bc05ff3","resolution":{"observed_at":"2026-06-30T18:44:59.998799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:5a98b79b43ce98a73c6127caab1e54e5da3e4e3c57f4c4456a66efafb38ed70e","observation_id":"05844d34-400c-49f8-8af9-a038d4f4d938","resolution":{"observed_at":"2026-06-30T18:45:00.006604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:24:29.218902Z","title":null,"venue":null,"work_id":"edcdee38-c8cd-400e-9fc0-c5f938b11fca","year":2023},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:be92ecd46c863a55aa0e8e13fa36b681c41a45d07eb1a44056fe0c1347fa55d1","observation_id":"2559375b-29b5-45f9-a9d7-969fbfefc272","resolution":{"observed_at":"2026-07-08T03:24:29.220341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:24:29.248596Z","title":null,"venue":null,"work_id":"2a1dd88f-4794-4a09-bd16-7dc237cbf6cf","year":2025},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:b39b10129649d736051689faede5be3703414b64fb71aa46cd59c3c1a18e6ad2","observation_id":"8dba083f-3d8e-4ca0-911b-05e0dde9afda","resolution":{"observed_at":"2026-07-08T03:24:29.249650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:24:29.255090Z","title":null,"venue":null,"work_id":"eac11e60-7a10-4839-9585-d1008ac0b5a0","year":2014},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:6574d657934464b5baff42911c0a5268f23e03f71fced63a103d5677a27ec8a8","observation_id":"fd4e7423-2404-4daa-9632-05cf0a239d5e","resolution":{"observed_at":"2026-07-08T03:24:29.256604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:24:29.247029Z","title":null,"venue":null,"work_id":"237aaddc-5dfe-490b-9f98-ee9f11eb8dd2","year":2024},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:396ab3d35d4f210f1be462542609b7e6d40ce40d86796acbcfd78d13a9343f4f","observation_id":"a834c5b9-d462-413b-9da7-233a0378f351","resolution":{"observed_at":"2026-07-08T03:24:29.248170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:24:29.243040Z","title":null,"venue":null,"work_id":"2216a2a8-8baa-4c90-a8e4-21532f03313a","year":2026},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:ac812c7211110a9bb90a3b6703643faa271383ae37238bfeecc9a4aa1d158ee3","observation_id":"4af8bb07-7737-4ccf-b81d-52952bb5de98","resolution":{"observed_at":"2026-07-08T03:24:29.244271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:24:29.245015Z","title":null,"venue":null,"work_id":"619822f8-5ab5-4769-a5cc-4032ae202d21","year":null},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:d96cdfe40c67263c1fcbac8d2c46d64c265ef9a818fc56b12b98e810a84d0697","observation_id":"da53c26e-2935-46bc-84bc-84adbabaf116","resolution":{"observed_at":"2026-07-08T03:24:29.246390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.24494","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T22:06:17.107020Z","title":"arXiv preprint arXiv:2509.24494 , year=","venue":null,"work_id":"a01a3e3b-9c01-4b4c-b81c-45e82993cffd","year":2025},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:c47ee5388f39877de7e11b95b8b7ebf5e62ba0e28294f12d9cced008ac10c27c","observation_id":"af53b1eb-c170-4b6b-b469-0eaad7526312","resolution":{"observed_at":"2026-06-30T18:45:00.021958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:24:29.237413Z","title":null,"venue":null,"work_id":"955d1db5-e796-4771-8b43-4ba840ca1766","year":2025},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:7bc7be8c6a9de230790480c48248164f6d27072a903fdc84f056875655c6f4e9","observation_id":"ec5dab0a-4c42-4ba2-a87f-62443f62d770","resolution":{"observed_at":"2026-07-08T03:24:29.238643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08645","last_updated":"2026-04-03T10:58:50Z","snapshot_observed_at":"2026-07-06T22:11:38.066500Z","submitted_at":"2025-08-12T05:20:14Z","title":"Quick on the Uptake: Eliciting Implicit Intents from Human Demonstrations for Personalized Mobile-Use Agents","version":2},"cited_work":{"arxiv_id":"2508.08645","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.08645","snapshot_observed_at":"2026-06-30T18:45:00.030783Z","title":"Quick on the Uptake: Eliciting Implicit Intents from Human Demonstrations for Personalized Mobile-Use Agents","venue":"cs.CL","work_id":"56c2e7c3-8605-4cf7-98e4-763cb1cbec13","year":2025},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"cited_paper":"/paper/2508.08645","citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:40a9db341a71ce25e6ca3d0cda46956e722bdb4d68f1f7eefa03ade3a1d35bec","observation_id":"19afffec-4d3f-4be3-99b4-811d225d9d56","resolution":{"observed_at":"2026-06-30T18:45:00.032350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03641","last_updated":"2026-04-11T14:07:11Z","snapshot_observed_at":"2026-07-06T22:40:56.386532Z","submitted_at":"2026-01-07T06:43:50Z","title":"Agent-Dice: Disentangling Knowledge Updates via Geometric Consensus for Agent Continual Learning","version":4},"cited_work":{"arxiv_id":"2601.03641","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.03641","snapshot_observed_at":"2026-07-01T22:56:20.149800Z","title":"Agent-Dice: Disentangling Knowledge Updates via Geometric Consensus for Agent Continual Learning","venue":"cs.CL","work_id":"0838a39e-db11-4a0d-bda1-0804d16f540f","year":2026},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"cited_paper":"/paper/2601.03641","citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:8104305654c5585a5276a9514e62d81de20c1dd963753ddd28e645d516cbfe4b","observation_id":"16016724-cecb-454d-bc0c-1db2e197e618","resolution":{"observed_at":"2026-06-30T18:45:00.017364Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:14:32.376690Z","title":null,"venue":null,"work_id":"df055d8c-5d95-45fa-87f7-de8ebb67fa5a","year":null},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:69cd0d043775802a2f0104623f72e8adb6548a0a94b1d126589cc5d1ed3505e4","observation_id":"478edfe6-9007-47b7-8a71-bd00cabe1951","resolution":{"observed_at":"2026-07-08T03:14:32.377998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:24:29.252896Z","title":null,"venue":null,"work_id":"81befa06-04a9-4334-955d-10b8acc82d45","year":2021},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:f44332d7e0fc9da86a3d8610b9ed2e57f25c0c8f323864b6d963f2b198e2d1b3","observation_id":"78cc5ab1-ad25-4b3b-879f-b0a620547974","resolution":{"observed_at":"2026-07-08T03:24:29.254361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10719","last_updated":"2024-10-10T08:30:17Z","snapshot_observed_at":"2026-07-06T18:01:05.698046Z","submitted_at":"2024-04-16T16:51:53Z","title":"Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study","version":3},"cited_work":{"arxiv_id":"2404.10719","doi":"10.48550/arxiv.2404.10719","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.10719","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Is dpo superior to ppo for llm alignment? a comprehensive study","venue":null,"work_id":"5ce8ff19-c68c-4255-bf4a-32ac6849467d","year":2024},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"cited_paper":"/paper/2404.10719","citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:c51cf33258f96ccbcf10d85552253a5bbe8653311d390f87d5efb41ab2d16177","observation_id":"476954c8-39db-48b1-992b-857b8286535b","resolution":{"observed_at":"2026-06-30T18:45:00.020003Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:24:29.239481Z","title":null,"venue":null,"work_id":"ea022ae2-fd19-4ba8-b95d-9fc6af527385","year":2025},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:4df78081c3ffd2de99fb46aef5c99e1690299e3046ce55b255d71635a3984491","observation_id":"d672ad6a-e207-47c4-9d71-e716ea3d0a0a","resolution":{"observed_at":"2026-07-08T03:24:29.240621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:14:30.515587Z","title":null,"venue":null,"work_id":"3c515541-659e-45ad-93d9-21be07632858","year":null},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:86c6e19ae92fe0294d343581d454984e707027cb0027fae9b685991fd25490b5","observation_id":"cd670495-ab17-492a-8409-efc158e88196","resolution":{"observed_at":"2026-07-08T03:14:30.516927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.01553","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T09:07:48.033764Z","title":"Medqa-cs: Benchmarking large language models clinical skills using an ai-sce framework.arXiv preprint arXiv:2410.01553, 2024","venue":null,"work_id":"a50000ab-9da0-4a5c-bc43-da26ee1c6408","year":2024},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:f8e2c65ffcb8920a52175e4869ee298e4b4b39bdc8ad2e001cceca8831c5762c","observation_id":"5038c3db-6877-4d5e-87e3-358170abf610","resolution":{"observed_at":"2026-06-30T18:45:00.040214Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:14:30.517675Z","title":null,"venue":null,"work_id":"df120851-d34f-44af-a664-ca28756609dc","year":null},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:07e1a915f1bf815ba58c2fa7e7bbf3a6ed1d9aa9ad5f98ffa8447468b62c2d22","observation_id":"47f6a740-431c-473c-be50-4875ce5426cf","resolution":{"observed_at":"2026-07-08T03:14:30.518729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03373","last_updated":"2025-02-05T17:13:32Z","snapshot_observed_at":"2026-07-06T20:31:41.231839Z","submitted_at":"2025-02-05T17:13:32Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":"2502.03373","doi":"10.48550/arxiv.2502.03373","metadata_source":"pith","pith_arxiv_id":"2502.03373","snapshot_observed_at":"2026-07-10T22:47:37.120136Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","venue":"cs.CL","work_id":"6d35a498-cdd6-463a-a0d9-5a29224a06d8","year":2025},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"cited_paper":"/paper/2502.03373","citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:70f8136bc5e7a031a7de40c0f4d4d5fda7b1c3890f73ff1a9a87a7332806a943","observation_id":"d8b70bc7-afb9-4dec-bdb2-68173fd29d14","resolution":{"observed_at":"2026-06-30T18:45:00.037289Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:24:29.244809Z","title":null,"venue":null,"work_id":"7b296d89-02af-4798-9570-55d27bfcbdf0","year":2024},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:c312e47654d49a356f67cae56e3781fa0cfc81c7c02133bda4990326281d4e6d","observation_id":"20cc0dad-aa8b-4093-bfa4-257780e5a2dd","resolution":{"observed_at":"2026-07-08T03:24:29.245986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:24:29.242859Z","title":null,"venue":null,"work_id":"7afbf4d0-cd63-4b24-8f81-cb68cd2e3f88","year":2020},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:b19bcff9382b3c1d0622da14bbbd7dd18fae616b796cf83565a68b491d775566","observation_id":"e3973420-d80c-4f8a-957f-03d966234fc2","resolution":{"observed_at":"2026-07-08T03:24:29.244025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10762","last_updated":"2025-04-15T02:44:55Z","snapshot_observed_at":"2026-07-06T19:33:12.610676Z","submitted_at":"2024-10-14T17:40:40Z","title":"AFlow: Automating Agentic Workflow Generation","version":4},"cited_work":{"arxiv_id":"2410.10762","doi":"10.48550/arxiv.2410.10762","metadata_source":"pith","pith_arxiv_id":"2410.10762","snapshot_observed_at":"2026-07-10T20:57:34.890252Z","title":"AFlow: Automating Agentic Workflow Generation","venue":"cs.AI","work_id":"7418aa37-1972-4dd5-8da6-c588dfce4c5b","year":2024},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"cited_paper":"/paper/2410.10762","citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:b5f70f55863e8d9fc9ab8b5474e157cc91ff50c95eb74a75b55a3f8d8a29555d","observation_id":"9a48f422-2a98-40c1-b246-dff66d837b00","resolution":{"observed_at":"2026-06-30T18:45:00.008976Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:20.107327+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:20.107327+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-06T18:07:14.918612Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":"2404.18922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-07-02T03:26:29.891495Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf.arXiv preprint arXiv:2404.18922","venue":null,"work_id":"f26483a9-ed17-46f4-b818-4362b330a98e","year":2024},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:5deef2d68c391cede80bf8f8950998b6b2a15847f2c58a659c0a2c39ae33989a","observation_id":"3aaa981a-1563-4582-893a-02f8c5267fe0","resolution":{"observed_at":"2026-06-30T18:45:00.011746Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:14:32.372190Z","title":null,"venue":null,"work_id":"d6ebdc68-6f8d-4910-b711-bb4d1980ffb5","year":2026},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:67b33ca2f67daca08a2901e3a476a35fcc14ccda3d7a82a351b453fde2a3cbee","observation_id":"a1706af6-efd1-4dd2-bf88-07bbd9172d02","resolution":{"observed_at":"2026-07-08T03:14:32.373407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:14:32.364960Z","title":null,"venue":null,"work_id":"2327b3e7-1d8f-4a47-9218-8b3156db472c","year":2025},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:3aae5d4d8b3f7d5b346fb695a79ea3b3e081ffede20251f0ef8827f137ece6d6","observation_id":"e4006fe9-2318-44e3-9894-06acc1198867","resolution":{"observed_at":"2026-07-08T03:14:32.366068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.18896","doi":"10.48550/arxiv.2506.18896","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Reasonflux-prm: Trajectory-aware prms for long chain-of-thought reasoning in llms","venue":null,"work_id":"909b544f-6432-416b-8e25-69156f9c292f","year":2025},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:08aae3ebd22ff4cced4851789d668e250684a7dbccd6f5dbda6efa4eeca5f353","observation_id":"c62fe006-797c-4623-94a2-f5bf72e7b08d","resolution":{"observed_at":"2026-06-30T18:45:00.014677Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":26,"verified_fuzzy":29},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"thesis":"As of 22 July 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2605.24005."}