{"as_of":"2026-08-08T23:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dc1bc5232f0a5a73f77376a40b8ab4aa2105cc5333877199c274962ceb91274c","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:20:42.777432Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.11953/citation-record","integrity":"/paper/2607.11953/integrity","json":"/paper/2607.11953/citation-record.json","paper":"/paper/2607.11953"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2105.14111","last_updated":"2023-01-09T21:33:02Z","snapshot_observed_at":"2026-08-04T22:03:53.464118Z","submitted_at":"2021-05-28T21:13:34Z","title":"Goal Misgeneralization in Deep Reinforcement Learning","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.14111","snapshot_observed_at":"2026-08-02T07:20:39.017070Z","title":"Langosco, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:39.017070Z"},"links":{"cited_paper":"/paper/2105.14111","citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:8dcc136561274cc15721bb2cf77045cb716c3c6816550247d998669dcd98192d","observation_id":"d61fb680-97ee-4070-b2e7-bfd16cc6631b","resolution":{"observed_at":"2026-08-02T07:20:39.017070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01790","last_updated":"2022-11-02T16:19:04Z","snapshot_observed_at":"2026-07-06T13:59:38.311532Z","submitted_at":"2022-10-04T17:57:53Z","title":"Goal Misgeneralization: Why Correct Specifications Aren't Enough For Correct Goals","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01790","snapshot_observed_at":"2026-08-02T07:20:39.148585Z","title":"Shah et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:39.148585Z"},"links":{"cited_paper":"/paper/2210.01790","citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:a6c591689d74078ecf4646c88108e8072ce49ad2df9abc870c77a6db1977c23f","observation_id":"140911e7-4a29-46ba-b69b-c6c9fecb38a0","resolution":{"observed_at":"2026-08-02T07:20:39.148585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10749","last_updated":"2023-05-02T14:16:15Z","snapshot_observed_at":"2026-08-05T14:55:09.743440Z","submitted_at":"2022-10-19T17:45:48Z","title":"Transformers Learn Shortcuts to Automata","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10749","snapshot_observed_at":"2026-08-02T07:20:39.305688Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:39.305688Z"},"links":{"cited_paper":"/paper/2210.10749","citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:80f29f138a1360558776d097c6e6b7f7e8ef9c3e3307be4310e0db9c69e50f34","observation_id":"c567fd28-cc10-46ca-9f8f-540a197b882b","resolution":{"observed_at":"2026-08-02T07:20:39.305688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:20:39.469103Z","title":null,"venue":null,"work_id":null,"year":1965},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:39.469103Z"},"links":{"citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:ddaca944f7692a30dcdc309905ec37e806eac1c054a9ada903a1cad418c5a168","observation_id":"73bd71ee-17b0-400e-b10e-0d158ba8ed68","resolution":{"observed_at":"2026-08-02T07:20:39.469103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:20:39.577137Z","title":"Krohn, J","venue":null,"work_id":null,"year":1965},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:39.577137Z"},"links":{"citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:b1e8cf9847923f630056a13031edf6da62294f8d0f8d2568a62702acbc8fcab2","observation_id":"83cfb748-d6aa-470b-8f55-611ec682b468","resolution":{"observed_at":"2026-08-02T07:20:39.577137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00208","last_updated":"2024-09-04T11:48:04Z","snapshot_observed_at":"2026-08-08T13:28:19.323577Z","submitted_at":"2023-11-01T00:38:26Z","title":"What Formal Languages Can Transformers Express? A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00208","snapshot_observed_at":"2026-08-02T07:20:39.658158Z","title":"Strobl et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:39.658158Z"},"links":{"cited_paper":"/paper/2311.00208","citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:9d546d7ac899f9f63043149671b954d8c08cfdae60a5cbbd22b26e30296b2281","observation_id":"89348c1a-0030-4524-8785-d0d45c6e03ba","resolution":{"observed_at":"2026-08-02T07:20:39.658158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20131","last_updated":"2024-10-25T14:50:45Z","snapshot_observed_at":"2026-08-01T18:24:13.057707Z","submitted_at":"2024-05-30T15:10:37Z","title":"Language Models Need Inductive Biases to Count Inductively","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20131","snapshot_observed_at":"2026-08-02T07:20:39.728166Z","title":"Chang, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:39.728166Z"},"links":{"cited_paper":"/paper/2405.20131","citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:e5308533612c670559003b4154512e2e5c6cc8903ff323b2e908869be2229926","observation_id":"560abdac-668a-4586-8384-5e6cb4106fdc","resolution":{"observed_at":"2026-08-02T07:20:39.728166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02140","last_updated":"2025-04-30T15:01:01Z","snapshot_observed_at":"2026-07-06T19:26:43.399756Z","submitted_at":"2024-10-03T01:52:01Z","title":"A Formal Framework for Understanding Length Generalization in Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02140","snapshot_observed_at":"2026-08-02T07:20:39.812148Z","title":"Huang et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:39.812148Z"},"links":{"cited_paper":"/paper/2410.02140","citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:610a20fdea334514ef6dcc8686bc54894ea180d14582f6da65c92ff9c8452757","observation_id":"b1f74490-9223-40c8-acb6-f91918ced5a5","resolution":{"observed_at":"2026-08-02T07:20:39.812148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:20:39.905726Z","title":"Huang, Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:39.905726Z"},"links":{"citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:bd4775e2f9b8ab0addcc173872225f24a2de05519dcc7570bb9bb6194f04d6c8","observation_id":"a435458a-fe38-4056-ad73-8ac71438132c","resolution":{"observed_at":"2026-08-02T07:20:39.905726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13382","last_updated":"2024-06-26T14:27:49Z","snapshot_observed_at":"2026-08-08T07:57:05.964427Z","submitted_at":"2022-10-24T16:29:55Z","title":"Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13382","snapshot_observed_at":"2026-08-02T07:20:39.972178Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:39.972178Z"},"links":{"cited_paper":"/paper/2210.13382","citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:32f028f94ecd0436776ce3bf8bbee455d1b72fca6d49c2648eae0be4b55405cd","observation_id":"ab15d13c-c081-44ce-aa44-bde93a5c7f76","resolution":{"observed_at":"2026-08-02T07:20:39.972178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00941","last_updated":"2023-09-07T20:36:48Z","snapshot_observed_at":"2026-07-06T16:13:34.788427Z","submitted_at":"2023-09-02T13:37:34Z","title":"Emergent Linear Representations in World Models of Self-Supervised Sequence Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00941","snapshot_observed_at":"2026-08-02T07:20:40.064986Z","title":"Nanda, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:40.064986Z"},"links":{"cited_paper":"/paper/2309.00941","citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:0f44ff9b34631f6bf215128b41ce0a22ce489f4d163235c3dd8cdc188706cc43","observation_id":"df5dc5b4-399b-4d3d-9142-6db19f2e0a8b","resolution":{"observed_at":"2026-08-02T07:20:40.064986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.03368","last_updated":"2019-09-08T02:04:32Z","snapshot_observed_at":"2026-08-07T17:17:16.059036Z","submitted_at":"2019-09-08T02:04:32Z","title":"Designing and Interpreting Probes with Control Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.03368","snapshot_observed_at":"2026-08-02T07:20:40.200581Z","title":"Hewitt, P","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:40.200581Z"},"links":{"cited_paper":"/paper/1909.03368","citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:06b1ae27ccd38fff4c49a9dbead24acbbdcec9d1769acec9b4b4c844a0504883","observation_id":"f78b623a-a6a7-4966-af2d-3a25b9606b3e","resolution":{"observed_at":"2026-08-02T07:20:40.200581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.01644","last_updated":"2018-11-22T23:40:00Z","snapshot_observed_at":"2026-07-06T05:13:30.860932Z","submitted_at":"2016-10-05T20:59:01Z","title":"Understanding intermediate layers using linear classifier probes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.01644","snapshot_observed_at":"2026-08-02T07:20:40.260439Z","title":"Alain, Y","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:40.260439Z"},"links":{"cited_paper":"/paper/1610.01644","citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:d1f1669f7d3b5c0fe9ce49b3d503dc89d33e5261e004b5015fb32a3eeafe5caf","observation_id":"455229a7-a2bf-4765-b3df-aa2748773362","resolution":{"observed_at":"2026-08-02T07:20:40.260439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02736","last_updated":"2019-06-06T17:55:17Z","snapshot_observed_at":"2026-07-06T07:58:33.660998Z","submitted_at":"2019-06-06T17:55:17Z","title":"DeepMDP: Learning Continuous Latent Space Models for Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.02736","snapshot_observed_at":"2026-08-02T07:20:40.388492Z","title":"Gelada, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:40.388492Z"},"links":{"cited_paper":"/paper/1906.02736","citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:640145d443fb3e4d97b601822b0937b871423943dab2c5bce7f5cd2a89ae05d4","observation_id":"6d4d84bb-1c77-4969-b53d-bb5e3a81d7e7","resolution":{"observed_at":"2026-08-02T07:20:40.388492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10742","last_updated":"2021-04-07T01:57:14Z","snapshot_observed_at":"2026-07-06T09:30:32.320227Z","submitted_at":"2020-06-18T17:59:35Z","title":"Learning Invariant Representations for Reinforcement Learning without Reconstruction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.10742","snapshot_observed_at":"2026-08-02T07:20:40.531548Z","title":"Zhang, R","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:40.531548Z"},"links":{"cited_paper":"/paper/2006.10742","citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:e927de423ce606a7dafcd3eb2bfc111292b9d09b78f8460874213a3534d2a0ad","observation_id":"666940ed-ca11-4316-b663-587cfa4c0341","resolution":{"observed_at":"2026-08-02T07:20:40.531548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05038","last_updated":"2022-06-05T01:19:29Z","snapshot_observed_at":"2026-07-06T11:56:24.775449Z","submitted_at":"2021-10-11T07:09:14Z","title":"Recurrent Model-Free RL Can Be a Strong Baseline for Many POMDPs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05038","snapshot_observed_at":"2026-08-02T07:20:40.649329Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:40.649329Z"},"links":{"cited_paper":"/paper/2110.05038","citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:304997c81e6aaf46c1adc505b3cdee8a53ffd66b0d350f66a4cf43951e4bf2ff","observation_id":"aade19e8-2102-4b5c-b4e0-7afadf6e6cfe","resolution":{"observed_at":"2026-08-02T07:20:40.649329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05397","last_updated":"2016-11-16T18:21:29Z","snapshot_observed_at":"2026-08-08T00:00:13.424932Z","submitted_at":"2016-11-16T18:21:29Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.05397","snapshot_observed_at":"2026-08-02T07:20:40.802032Z","title":"Jaderberg et al","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:40.802032Z"},"links":{"cited_paper":"/paper/1611.05397","citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:9227fcefd0f365beeea8119f69e14170994bad2b215a118090bc0e50971a24a6","observation_id":"30a8ef44-1c82-405a-ab56-d557f2d2ea0d","resolution":{"observed_at":"2026-08-02T07:20:40.802032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:20:40.941218Z","title":"Toro Icarte et al","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:40.941218Z"},"links":{"citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:793ee14ce5d4234b8025dd4007cc2a23613eb2fd011a4eabbd6d444eca99013f","observation_id":"dbb8f9d2-05e9-4f13-b037-3bfde2b3362b","resolution":{"observed_at":"2026-08-02T07:20:40.941218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:20:41.057483Z","title":null,"venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:41.057483Z"},"links":{"citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:a7548900446b8a1ec16a2325712c328d3dd8cb3c086cb2953fabbb7f35ecd3ac","observation_id":"8200f6e3-2ba5-4c7e-8e71-7f5e68e4dc73","resolution":{"observed_at":"2026-08-02T07:20:41.057483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:20:41.115389Z","title":"Oncina, P","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:41.115389Z"},"links":{"citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:d6663f5a74d64cddad3eed58949b9306e30a43a93c79581726e5932c71e3db80","observation_id":"e17b4226-8914-4b24-906d-da6e85a35226","resolution":{"observed_at":"2026-08-02T07:20:41.115389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.02098","last_updated":"2023-02-28T13:22:17Z","snapshot_observed_at":"2026-08-08T23:24:14.529963Z","submitted_at":"2022-07-05T15:06:11Z","title":"Neural Networks and the Chomsky Hierarchy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.02098","snapshot_observed_at":"2026-08-02T07:20:41.199053Z","title":"Del\\'etang, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:41.199053Z"},"links":{"cited_paper":"/paper/2207.02098","citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:0e0f3a39cb19c45e8a39276755d3beb4434fb81c7016c6427dc10d202752e12c","observation_id":"3ec6d875-a65b-4b1b-ab40-7243740a6c55","resolution":{"observed_at":"2026-08-02T07:20:41.199053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11264","last_updated":"2020-10-08T12:55:37Z","snapshot_observed_at":"2026-08-08T13:16:05.781323Z","submitted_at":"2020-09-23T17:21:33Z","title":"On the Ability and Limitations of Transformers to Recognize Formal Languages","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.11264","snapshot_observed_at":"2026-08-02T07:20:41.341600Z","title":"Bhattamishra, K","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:41.341600Z"},"links":{"cited_paper":"/paper/2009.11264","citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:d7f9e6ccc5194df3a72baf75193107fe208506025b781e720d5377e0357d0af7","observation_id":"3a10fe2c-bacc-4f55-b82d-0b90134bca24","resolution":{"observed_at":"2026-08-02T07:20:41.341600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.04908","last_updated":"2018-05-13T16:28:32Z","snapshot_observed_at":"2026-08-04T16:30:02.817736Z","submitted_at":"2018-05-13T16:28:32Z","title":"On the Practical Computational Power of Finite Precision RNNs for Language Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.04908","snapshot_observed_at":"2026-08-02T07:20:41.419333Z","title":"Weiss, Y","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:41.419333Z"},"links":{"cited_paper":"/paper/1805.04908","citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:233cdd019fd0653955789f1e24bb41df754350cab3aaca877257e374e1856880","observation_id":"4030d316-9fa7-40c1-952d-2d84142dd6bf","resolution":{"observed_at":"2026-08-02T07:20:41.419333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.10297","last_updated":"2019-02-27T01:45:01Z","snapshot_observed_at":"2026-07-06T07:35:43.313450Z","submitted_at":"2019-02-27T01:45:01Z","title":"Representing Formal Languages: A Comparison Between Finite Automata and Recurrent Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.10297","snapshot_observed_at":"2026-08-02T07:20:41.452821Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:41.452821Z"},"links":{"cited_paper":"/paper/1902.10297","citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:eea90988e7f4b84f93595c3bac770c67e0a5ea6383213d5060f78cf1d74c944a","observation_id":"b11b8231-fb1b-49e1-9804-6c6e4dec6508","resolution":{"observed_at":"2026-08-02T07:20:41.452821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09477","last_updated":"2021-12-17T12:39:52Z","snapshot_observed_at":"2026-08-04T06:11:42.209948Z","submitted_at":"2021-12-17T12:39:52Z","title":"Learning Reward Machines: A Study in Partially Observable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09477","snapshot_observed_at":"2026-08-02T07:20:41.610812Z","title":"Toro Icarte, et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:41.610812Z"},"links":{"cited_paper":"/paper/2112.09477","citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:7ff5cd0e31b2d5aef52b64bd7bb1ff0ae85c5813fb1f20db4b265496707e0424","observation_id":"66f0636a-0d80-4439-bf78-2eaa02cb5b52","resolution":{"observed_at":"2026-08-02T07:20:41.610812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:20:41.713699Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:41.713699Z"},"links":{"citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:b051183594cf2219ddb4c6db4a4467e1c47999d32e4e7d8dbdbf67530acc7be0","observation_id":"08e11add-eb9e-402b-97b9-12d0a6102bd1","resolution":{"observed_at":"2026-08-02T07:20:41.713699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:20:41.809419Z","title":null,"venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:41.809419Z"},"links":{"citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:00f93d39b0721915ecb4504f60d0f067f977c2213039839bbbc9632efadfce7b","observation_id":"b5840241-7c2a-430d-acef-67371c5f3803","resolution":{"observed_at":"2026-08-02T07:20:41.809419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11979","last_updated":"2019-11-04T12:59:24Z","snapshot_observed_at":"2026-07-06T07:56:11.645313Z","submitted_at":"2019-05-28T17:56:19Z","title":"Causal Confusion in Imitation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11979","snapshot_observed_at":"2026-08-02T07:20:41.928096Z","title":"de Haan, D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:41.928096Z"},"links":{"cited_paper":"/paper/1905.11979","citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:88b0e49dddfd00d1ca39c7b183550de2df52c2391bcdbcde0ce2815c4bb5d313","observation_id":"e8a6c98c-8b86-4c82-be75-85499fa511f9","resolution":{"observed_at":"2026-08-02T07:20:41.928096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.03544","last_updated":"2022-02-14T09:05:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-10T18:58:52Z","title":"The Effects of Reward Misspecification: Mapping and Mitigating Misaligned Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.03544","snapshot_observed_at":"2026-08-02T07:20:42.024058Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:42.024058Z"},"links":{"cited_paper":"/paper/2201.03544","citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:a3aad5607efbe904dfee2c22411e1640aa7ae252f5238587e0e53dbd25eaf961","observation_id":"02afc5d4-fb72-41e5-b792-d00cf9a23a28","resolution":{"observed_at":"2026-08-02T07:20:42.024058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-02T07:20:42.144350Z","title":"Skalse, N","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:42.144350Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:2c5200d0c7858e74d841fd4e9cfcb5abace0610e68c28dc0a2af5dc2a2164bfa","observation_id":"417eb3f8-4ef7-4e8b-b103-e4dd9e84ed60","resolution":{"observed_at":"2026-08-02T07:20:42.144350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.4121/uuid:3926db30-f712-4394-aebc-75976070e91f","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Data Archiving and Networked Services (DANS)","work_id":"1cb9cf7b-b7fb-4e75-ab15-da8028ba6ae5","year":2012},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:42.220889Z"},"links":{"citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:43af6f6850d5fd6dce46e32f57de4ab978e4beab86e261797e1bb74f8f8cf8e9","observation_id":"39b40147-7abb-4430-91b3-d97f2a9dda2a","resolution":{"observed_at":"2026-08-02T07:23:24.174428Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.4121/uuid:a0addfda-2044-4541-a450-fdcc9fe16d17","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Data Archiving and Networked Services (DANS)","work_id":"0ef58ed0-6d9a-474c-acd3-77d8fb9d94b1","year":2015},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:42.299411Z"},"links":{"citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:e4cf128d20abe85c348e716c6376e1112259abc7c73f7642f98b171142750ee8","observation_id":"46d724e9-46e5-4897-8fe6-65162607923b","resolution":{"observed_at":"2026-08-02T07:23:24.089117Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.4121/uuid:5f3067df-f10b-45da-b98b-86ae4c7a310b","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Data Archiving and Networked Services (DANS)","work_id":"6322861c-f9ed-4560-a490-dd55a12a23cb","year":2017},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:42.383344Z"},"links":{"citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:56f8e1359ecd73dfa92200d0a4d06f9a818626aa9b493070b72886e8ea5e2ef6","observation_id":"4be6bce4-6f46-4930-80e8-9665e1a357e2","resolution":{"observed_at":"2026-08-02T07:23:24.007557Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.4121/uuid:d06aff4b-79f0-45e6-8ec8-e19730c248f1","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Figshare","work_id":"8a518049-4f8b-4d0b-ba34-364cf201055a","year":2019},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:42.510768Z"},"links":{"citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:db41d03666c490450ef5333ad5199db6969b803b8aa01c008bbd2d01a4bf7d7d","observation_id":"97a06e42-b5fb-48b8-8759-e01212d9bc70","resolution":{"observed_at":"2026-08-02T07:23:23.926400Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.4121/uuid:76c46b83-c930-4798-a1c9-4be94dfeb741","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mannhardt","venue":"Data Archiving and Networked Services (DANS)","work_id":"8fed1e29-7bdd-4cff-aaae-d0f222399e08","year":2017},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:42.567297Z"},"links":{"citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:8cd5eb28d78ed08133c11490c613f9c8fd79c68be7810ad1a7e32214e85c659a","observation_id":"e137be10-7e7a-4e13-be17-1faeaadfe8eb","resolution":{"observed_at":"2026-08-02T07:23:23.853155Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.4121/uuid:270fd440-1057-4fb9-89a9-b699b47990f5","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"de Leoni, F","venue":"Data Archiving and Networked Services (DANS)","work_id":"1f2b853f-5d58-48bc-b198-6fa780ed14d1","year":2015},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:42.635458Z"},"links":{"citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:972d2226e76f90343ca2e1d78694aa6c37de1ef0781c49be358f5d01bbf95970","observation_id":"1e0b8361-7ec7-4ff6-aa77-dc5e6858ba9b","resolution":{"observed_at":"2026-08-02T07:23:23.782976Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:20:42.777432Z","title":"Mannhardt","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:42.777432Z"},"links":{"citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:59e7ef701a36d8d2fe240332239be3feb9fdf41b1f656ef66e0f1ee5fff7be8a","observation_id":"ccec93eb-6093-492d-955c-402c53032ee0","resolution":{"observed_at":"2026-08-02T07:20:42.777432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T05:16:44.265065Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":6,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2607.11953."}