{"as_of":"2026-08-10T11:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3a2ec377cc39cba3c641380c49edee6fc0c3fa5bd015d944332182c4ba78d334","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T21:21:34.220265Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T20:46:14.370062Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2103.06257","last_updated":"2022-05-05T17:01:45Z","snapshot_observed_at":"2026-07-06T10:48:42.637397Z","submitted_at":"2021-03-10T18:45:48Z","title":"Maximum Entropy RL (Provably) Solves Some Robust RL Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.06257","snapshot_observed_at":"2026-08-09T21:21:34.220265Z","title":"Maximum entropy rl (provably) solves some robust rl problems,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.19102","last_updated":"2025-03-06T09:23:22Z","snapshot_observed_at":"2026-08-10T09:59:48.047098Z","submitted_at":"2025-01-31T12:51:55Z","title":"Reinforcement Learning on Reconfigurable Hardware: Overcoming Material Variability in Laser Material Processing","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T21:21:34.220265Z"},"links":{"cited_paper":"/paper/2103.06257","citing_paper":"/paper/2501.19102"},"observation_digest":"sha256:25e87226cebc76f19eacce6d97fa083fa6392a388f9b3f65814c81fe6ff33653","observation_id":"4a14fb0d-c3b4-4b8a-b61e-430707e62963","resolution":{"observed_at":"2026-08-09T21:21:34.220265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06257","last_updated":"2022-05-05T17:01:45Z","snapshot_observed_at":"2026-07-06T10:48:42.637397Z","submitted_at":"2021-03-10T18:45:48Z","title":"Maximum Entropy RL (Provably) Solves Some Robust RL Problems","version":2},"cited_work":{"arxiv_id":"2103.06257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.06257","snapshot_observed_at":"2026-07-01T20:46:14.370062Z","title":"Maximum entropy RL (provably) solves some robust RL problems","venue":null,"work_id":"24018614-8b61-4673-9779-d8329016872c","year":2021},"citing_paper":{"arxiv_id":"2505.15134","last_updated":"2025-05-21T05:39:11Z","snapshot_observed_at":"2026-08-08T21:58:35.154185Z","submitted_at":"2025-05-21T05:39:11Z","title":"The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T15:58:33.219451Z"},"links":{"cited_paper":"/paper/2103.06257","citing_paper":"/paper/2505.15134"},"observation_digest":"sha256:3ccdf27e3c9813c9b7fa5347a1749d3ea8aac9360998ef6679e603d16b2d6b79","observation_id":"0b14e092-f610-4b31-9de8-b4197e794a4a","resolution":{"observed_at":"2026-05-18T15:58:33.623204Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06257","last_updated":"2022-05-05T17:01:45Z","snapshot_observed_at":"2026-07-06T10:48:42.637397Z","submitted_at":"2021-03-10T18:45:48Z","title":"Maximum Entropy RL (Provably) Solves Some Robust RL Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.06257","snapshot_observed_at":"2026-08-07T14:26:48.211513Z","title":"Maximum entropy RL (provably) solves some robust RL problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:48.211513Z"},"links":{"cited_paper":"/paper/2103.06257","citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:8644e0a542f3658094d0454285803373f434fcefdeda3801df2b0135035515df","observation_id":"016885b5-6336-4a61-83bc-6130eab112a1","resolution":{"observed_at":"2026-08-07T14:26:48.211513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06257","last_updated":"2022-05-05T17:01:45Z","snapshot_observed_at":"2026-07-06T10:48:42.637397Z","submitted_at":"2021-03-10T18:45:48Z","title":"Maximum Entropy RL (Provably) Solves Some Robust RL Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.06257","snapshot_observed_at":"2026-08-07T10:22:17.058715Z","title":"and Levine, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:17.058715Z"},"links":{"cited_paper":"/paper/2103.06257","citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:22a7ac6bd4f67bc4c3c1d71bfff7e7ebf08f5c847bbf6f69f25d884686bf6464","observation_id":"11438e06-5740-4e59-8130-5d739374ddb3","resolution":{"observed_at":"2026-08-07T10:22:17.058715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06257","last_updated":"2022-05-05T17:01:45Z","snapshot_observed_at":"2026-07-06T10:48:42.637397Z","submitted_at":"2021-03-10T18:45:48Z","title":"Maximum Entropy RL (Provably) Solves Some Robust RL Problems","version":2},"cited_work":{"arxiv_id":"2103.06257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.06257","snapshot_observed_at":"2026-07-01T20:46:14.370062Z","title":"Maximum entropy RL (provably) solves some robust RL problems","venue":null,"work_id":"24018614-8b61-4673-9779-d8329016872c","year":2021},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":127,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2103.06257","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:0e15bd9bf3df9e72b641a6a4a3320b0a543739f021481a5dd7202c0fbd0d6ddd","observation_id":"d459e129-a441-41ff-abb6-43e3d7f28960","resolution":{"observed_at":"2026-05-18T00:02:25.331332Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06257","last_updated":"2022-05-05T17:01:45Z","snapshot_observed_at":"2026-07-06T10:48:42.637397Z","submitted_at":"2021-03-10T18:45:48Z","title":"Maximum Entropy RL (Provably) Solves Some Robust RL Problems","version":2},"cited_work":{"arxiv_id":"2103.06257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.06257","snapshot_observed_at":"2026-07-01T20:46:14.370062Z","title":"Maximum entropy RL (provably) solves some robust RL problems","venue":null,"work_id":"24018614-8b61-4673-9779-d8329016872c","year":2021},"citing_paper":{"arxiv_id":"2509.20265","last_updated":"2026-04-29T12:32:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T15:52:36Z","title":"Failure Modes of Maximum Entropy RLHF","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-18T14:02:11.084514Z"},"links":{"cited_paper":"/paper/2103.06257","citing_paper":"/paper/2509.20265"},"observation_digest":"sha256:5ae95094156f0a5176e75e3cfd4d74b65a3c9d7496f03bd0e00538f03d16ec32","observation_id":"59c021e6-e479-44db-b6e2-9e0602249ccd","resolution":{"observed_at":"2026-05-18T14:02:39.730332Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06257","last_updated":"2022-05-05T17:01:45Z","snapshot_observed_at":"2026-07-06T10:48:42.637397Z","submitted_at":"2021-03-10T18:45:48Z","title":"Maximum Entropy RL (Provably) Solves Some Robust RL Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.06257","snapshot_observed_at":"2026-08-04T14:58:36.682378Z","title":"Maximum entropy rl (provably) solves some robust rl problems.arXiv preprint arXiv:2103.06257,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-09T19:56:29.076727Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T14:58:36.682378Z"},"links":{"cited_paper":"/paper/2103.06257","citing_paper":"/paper/2510.00037"},"observation_digest":"sha256:717c0d2c417ea9c8bf48530808d7f4e0665266ea320b2adeac3a1d167c37c026","observation_id":"4a3fec9a-378b-4b3f-a59a-966e6d35fca0","resolution":{"observed_at":"2026-08-04T14:58:36.682378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06257","last_updated":"2022-05-05T17:01:45Z","snapshot_observed_at":"2026-07-06T10:48:42.637397Z","submitted_at":"2021-03-10T18:45:48Z","title":"Maximum Entropy RL (Provably) Solves Some Robust RL Problems","version":2},"cited_work":{"arxiv_id":"2103.06257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.06257","snapshot_observed_at":"2026-07-01T20:46:14.370062Z","title":"Maximum entropy RL (provably) solves some robust RL problems","venue":null,"work_id":"24018614-8b61-4673-9779-d8329016872c","year":2021},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2103.06257","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:0b65010c2ebeefd542d8133258b7de841103aabd55e1cd765db267f4ff8fe81d","observation_id":"e2735e6a-ddad-4c94-a5ac-f5f002fc71dd","resolution":{"observed_at":"2026-05-16T05:37:24.301959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06257","last_updated":"2022-05-05T17:01:45Z","snapshot_observed_at":"2026-07-06T10:48:42.637397Z","submitted_at":"2021-03-10T18:45:48Z","title":"Maximum Entropy RL (Provably) Solves Some Robust RL Problems","version":2},"cited_work":{"arxiv_id":"2103.06257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.06257","snapshot_observed_at":"2026-07-01T20:46:14.370062Z","title":"Maximum entropy RL (provably) solves some robust RL problems","venue":null,"work_id":"24018614-8b61-4673-9779-d8329016872c","year":2021},"citing_paper":{"arxiv_id":"2604.10974","last_updated":"2026-04-15T07:15:04Z","snapshot_observed_at":"2026-07-31T13:13:30.847119Z","submitted_at":"2026-04-13T04:23:54Z","title":"Robust Adversarial Policy Optimization Under Dynamics Uncertainty","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:33.267264Z"},"links":{"cited_paper":"/paper/2103.06257","citing_paper":"/paper/2604.10974"},"observation_digest":"sha256:2bafe09abede6f55072aa6d8a5f93ab8aeda7c7cc9e395a4ed2b46658bf49351","observation_id":"f0f9b06c-633e-4a81-afa9-c670311ac458","resolution":{"observed_at":"2026-05-11T09:26:03.569035Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06257","last_updated":"2022-05-05T17:01:45Z","snapshot_observed_at":"2026-07-06T10:48:42.637397Z","submitted_at":"2021-03-10T18:45:48Z","title":"Maximum Entropy RL (Provably) Solves Some Robust RL Problems","version":2},"cited_work":{"arxiv_id":"2103.06257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.06257","snapshot_observed_at":"2026-07-01T20:46:14.370062Z","title":"Maximum entropy RL (provably) solves some robust RL problems","venue":null,"work_id":"24018614-8b61-4673-9779-d8329016872c","year":2021},"citing_paper":{"arxiv_id":"2604.14265","last_updated":"2026-04-15T17:12:56Z","snapshot_observed_at":"2026-07-06T23:02:05.116649Z","submitted_at":"2026-04-15T17:12:56Z","title":"Reinforcement Learning via Value Gradient Flow","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-10T13:18:16.532434Z"},"links":{"cited_paper":"/paper/2103.06257","citing_paper":"/paper/2604.14265"},"observation_digest":"sha256:04bc29f95ad0656a7ebe4c52cc13b8527bbaa643c971662e28ec8a30824f2ea4","observation_id":"7c2f6ba4-1c4b-44cc-a561-99e174eaaa0f","resolution":{"observed_at":"2026-05-10T13:20:25.673260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06257","last_updated":"2022-05-05T17:01:45Z","snapshot_observed_at":"2026-07-06T10:48:42.637397Z","submitted_at":"2021-03-10T18:45:48Z","title":"Maximum Entropy RL (Provably) Solves Some Robust RL Problems","version":2},"cited_work":{"arxiv_id":"2103.06257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.06257","snapshot_observed_at":"2026-07-01T20:46:14.370062Z","title":"Maximum entropy RL (provably) solves some robust RL problems","venue":null,"work_id":"24018614-8b61-4673-9779-d8329016872c","year":2021},"citing_paper":{"arxiv_id":"2604.24957","last_updated":"2026-05-19T21:17:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T19:52:38Z","title":"Compute Aligned Training: Optimizing for Test Time Inference","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:53.868648Z"},"links":{"cited_paper":"/paper/2103.06257","citing_paper":"/paper/2604.24957"},"observation_digest":"sha256:d8f7e1178b10d440f684ea5bf23405e82a8a256201b1f4eb8f054df8f435094b","observation_id":"31e20043-8c2b-4860-bfec-54c83132d110","resolution":{"observed_at":"2026-05-11T21:51:11.758180Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06257","last_updated":"2022-05-05T17:01:45Z","snapshot_observed_at":"2026-07-06T10:48:42.637397Z","submitted_at":"2021-03-10T18:45:48Z","title":"Maximum Entropy RL (Provably) Solves Some Robust RL Problems","version":2},"cited_work":{"arxiv_id":"2103.06257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.06257","snapshot_observed_at":"2026-07-01T20:46:14.370062Z","title":"Maximum entropy RL (provably) solves some robust RL problems","venue":null,"work_id":"24018614-8b61-4673-9779-d8329016872c","year":2021},"citing_paper":{"arxiv_id":"2604.24957","last_updated":"2026-05-19T21:17:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T19:52:38Z","title":"Compute Aligned Training: Optimizing for Test Time Inference","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T08:41:49.623026Z"},"links":{"cited_paper":"/paper/2103.06257","citing_paper":"/paper/2604.24957"},"observation_digest":"sha256:abf5752ff7f0c719b60ebb8dc58a4825e27eec50f06a571d8f665fbed55088a9","observation_id":"d65b10d3-0de8-4757-bb36-2d9b6dc885ce","resolution":{"observed_at":"2026-05-21T08:44:04.636436Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06257","last_updated":"2022-05-05T17:01:45Z","snapshot_observed_at":"2026-07-06T10:48:42.637397Z","submitted_at":"2021-03-10T18:45:48Z","title":"Maximum Entropy RL (Provably) Solves Some Robust RL Problems","version":2},"cited_work":{"arxiv_id":"2103.06257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.06257","snapshot_observed_at":"2026-07-01T20:46:14.370062Z","title":"Maximum entropy RL (provably) solves some robust RL problems","venue":null,"work_id":"24018614-8b61-4673-9779-d8329016872c","year":2021},"citing_paper":{"arxiv_id":"2605.09349","last_updated":"2026-05-10T06:02:10Z","snapshot_observed_at":"2026-07-06T23:21:26.017420Z","submitted_at":"2026-05-10T06:02:10Z","title":"Mutual Information Optimal Density Control of Linear Systems and Generalized Schr\\\"{o}dinger Bridges with Reference Refinement","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T04:48:43.030341Z"},"links":{"cited_paper":"/paper/2103.06257","citing_paper":"/paper/2605.09349"},"observation_digest":"sha256:1b346122400bcc7a58afebac24349a5a292d76ca6d0aa742dc2b76548820ffdc","observation_id":"76d63982-a189-45d3-a6d0-3cccde97d05e","resolution":{"observed_at":"2026-05-12T05:56:24.496334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06257","last_updated":"2022-05-05T17:01:45Z","snapshot_observed_at":"2026-07-06T10:48:42.637397Z","submitted_at":"2021-03-10T18:45:48Z","title":"Maximum Entropy RL (Provably) Solves Some Robust RL Problems","version":2},"cited_work":{"arxiv_id":"2103.06257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.06257","snapshot_observed_at":"2026-07-01T20:46:14.370062Z","title":"Maximum entropy RL (provably) solves some robust RL problems","venue":null,"work_id":"24018614-8b61-4673-9779-d8329016872c","year":2021},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2103.06257","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:ae4faaf837da2fbe2850930247473ad5ba3d7b216f37f84cf99887e8a42c8097","observation_id":"94f56815-2179-4fda-b097-666a5c0f1000","resolution":{"observed_at":"2026-05-20T05:33:04.118658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06257","last_updated":"2022-05-05T17:01:45Z","snapshot_observed_at":"2026-07-06T10:48:42.637397Z","submitted_at":"2021-03-10T18:45:48Z","title":"Maximum Entropy RL (Provably) Solves Some Robust RL Problems","version":2},"cited_work":{"arxiv_id":"2103.06257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.06257","snapshot_observed_at":"2026-07-01T20:46:14.370062Z","title":"Maximum entropy RL (provably) solves some robust RL problems","venue":null,"work_id":"24018614-8b61-4673-9779-d8329016872c","year":2021},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-08-01T08:48:45.727255Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"cited_paper":"/paper/2103.06257","citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:5c1914f8f83a1530a071605a5e06bc14d6d23ecf73147eed656ba133e2c10407","observation_id":"247da142-9fa0-4733-9d82-fb746e4928b3","resolution":{"observed_at":"2026-06-30T18:45:00.059456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06257","last_updated":"2022-05-05T17:01:45Z","snapshot_observed_at":"2026-07-06T10:48:42.637397Z","submitted_at":"2021-03-10T18:45:48Z","title":"Maximum Entropy RL (Provably) Solves Some Robust RL Problems","version":2},"cited_work":{"arxiv_id":"2103.06257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.06257","snapshot_observed_at":"2026-07-01T20:46:14.370062Z","title":"Maximum entropy RL (provably) solves some robust RL problems","venue":null,"work_id":"24018614-8b61-4673-9779-d8329016872c","year":2021},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":223,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2103.06257","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:c55bf8f7411ccf2c5189b8f3c3a5a889c1701bf2edf2cf660a00aa7374d7b228","observation_id":"842a6a8c-96b6-409e-bc06-05431658e723","resolution":{"observed_at":"2026-07-01T20:46:14.371614Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06257","last_updated":"2022-05-05T17:01:45Z","snapshot_observed_at":"2026-07-06T10:48:42.637397Z","submitted_at":"2021-03-10T18:45:48Z","title":"Maximum Entropy RL (Provably) Solves Some Robust RL Problems","version":2},"cited_work":{"arxiv_id":"2103.06257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.06257","snapshot_observed_at":"2026-07-01T20:46:14.370062Z","title":"Maximum entropy RL (provably) solves some robust RL problems","venue":null,"work_id":"24018614-8b61-4673-9779-d8329016872c","year":2021},"citing_paper":{"arxiv_id":"2606.07602","last_updated":"2026-05-29T09:31:25Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-05-29T09:31:25Z","title":"Sample-Efficient Post-Training for LEGO Spatial-Physics Reasoning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-06-28T23:38:38.127345Z"},"links":{"cited_paper":"/paper/2103.06257","citing_paper":"/paper/2606.07602"},"observation_digest":"sha256:02aa737722c7ce0acb61b54b2acaef1c7350e76112b0c79ad00c905c7b6d03e9","observation_id":"ad5219bc-7e7c-4b91-9800-317de72983df","resolution":{"observed_at":"2026-06-28T23:42:49.531045Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2103.06257/citation-record","integrity":"/paper/2103.06257/integrity","json":"/paper/2103.06257/citation-record.json","paper":"/paper/2103.06257"},"outbound":[],"paper":{"arxiv_id":"2103.06257","last_updated":"2022-05-05T17:01:45Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T10:48:42.637397Z","submitted_at":"2021-03-10T18:45:48Z","title":"Maximum Entropy RL (Provably) Solves Some Robust RL Problems"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 17 inbound Pith citation observations for arXiv:2103.06257."}