{"as_of":"2026-08-05T03:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9ff04fc8c9e0f1fc522258e4db042e3396121d66a0694adf1e5ac5ec3058c880","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T13:53:42.130475Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.18966/citation-record","integrity":"/paper/2607.18966/integrity","json":"/paper/2607.18966/citation-record.json","paper":"/paper/2607.18966"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:38.421562Z","title":"Write a Python function that takes a list of user objects and returns a list of names for users who have the role ’admin’","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:38.421562Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:91c9b2d24640c131fa06da1071ab5cd3c76a3322835be7f29e6790f8d1636ef9","observation_id":"ecf9ef86-baa1-425f-ac13-a0878e314830","resolution":{"observed_at":"2026-08-01T13:53:38.421562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:38.538835Z","title":"Pairs every problem with an addi- tional impossible test so no honest implementation can satisfy all checks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:38.538835Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:cef6f8011f24345e88ba0d43f48216c78f7b462d7b881f879723ca7ffa1a1189","observation_id":"e82474ae-6998-4518-bba3-0cc56bc82cc4","resolution":{"observed_at":"2026-08-01T13:53:38.538835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13208","last_updated":"2024-04-19T22:55:23Z","snapshot_observed_at":"2026-08-02T11:48:17.206729Z","submitted_at":"2024-04-19T22:55:23Z","title":"The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13208","snapshot_observed_at":"2026-08-01T13:53:38.281052Z","title":"reward-seeking","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:38.281052Z"},"links":{"cited_paper":"/paper/2404.13208","citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:6ecceeb158c3fe7d916b89ce26e6d0929a3ab8506011da0317d9a59d2960ffc1","observation_id":"15a3af31-2d05-47f0-8300-a569eb1c83ed","resolution":{"observed_at":"2026-08-01T13:53:38.281052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:38.822681Z","title":"bro- ken promise","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:38.822681Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:47df9fb61a4d70a7787c43f86c98993f6298d5f659c16cc07c513c9eb689de4b","observation_id":"4b7aad6a-5036-447e-805d-06dc5dd89215","resolution":{"observed_at":"2026-08-01T13:53:38.822681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:38.978472Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:38.978472Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:8cd8285cce069080f3817a259a2da0666d4d3f2bbff100678dcdfbeb018d6f43","observation_id":"8c5f56ce-b29a-4ba5-8509-f31e59e99ad0","resolution":{"observed_at":"2026-08-01T13:53:38.978472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:38.695286Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:38.695286Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:a31e8f3a9c457a2956108fa7f6dbbe3f17d2bbdb28ee27702c8d144360b153be","observation_id":"71ad737f-c38d-445c-b825-eb5abbb76044","resolution":{"observed_at":"2026-08-01T13:53:38.695286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:39.144544Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:39.144544Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:cb43dbd761d8c77e50e2bf7f0fc9baa63dc2e2132ae359cb0c7fb312f9cd62e7","observation_id":"034d0657-a8ce-4650-8872-0edbb5cc2f62","resolution":{"observed_at":"2026-08-01T13:53:39.144544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:39.216277Z","title":"Used to confirm that SDF instilled the intended belief","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:39.216277Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:29eb7b818916dc36c3a3f11a5fab4ff6a377ef931c9132fabd63b4de9939600f","observation_id":"622291f8-0b38-4d2b-b85d-0580f2f3c439","resolution":{"observed_at":"2026-08-01T13:53:39.216277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:39.056105Z","title":"Detects revealed preference for the reward signal over direct user instruction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:39.056105Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:d2213fe9af475efc8f4498745c3b65db7c3dbc4ee8a8ff325ed3e3277eea44a0","observation_id":"a06ee16e-d3f6-4316-b535-66a812a557a4","resolution":{"observed_at":"2026-08-01T13:53:39.056105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:39.484783Z","title":"(2026): the model works through a queue of small tasks in a bash loop and writes one Python function along the way","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:39.484783Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:9de1b37bfba403b5b73d628b24ffe27125df3c5a26770a320a9bc9836ca871b6","observation_id":"3154a545-f68b-4aef-9cca-7c0dd2ee001f","resolution":{"observed_at":"2026-08-01T13:53:39.484783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:39.630672Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:39.630672Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:e90ea412c6044caf5dfacf37a9347575b4769bfbbf0d29d9fda14c5e4408c9c3","observation_id":"9df89ec9-2a47-48fb-9da3-dd1212963c4a","resolution":{"observed_at":"2026-08-01T13:53:39.630672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:39.351067Z","title":"Used to read out which authority the model actually targets","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:39.351067Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:d71796a415b2d667efd76c90ae9a751b41bacfe86b34508b8ece6d011f1590d8","observation_id":"709d6532-40bb-4874-8d41-cb2a09f11174","resolution":{"observed_at":"2026-08-01T13:53:39.351067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:39.901039Z","title":"shutdown avoidance, resource acquisition), framed as input to an align- ment team’s monitoring","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:39.901039Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:7986628c0ddc3471b77a08c9bd63f339946c4216298a41c1b43493a89a367ce7","observation_id":"90426d45-1988-48c1-8be9-1886f7b67777","resolution":{"observed_at":"2026-08-01T13:53:39.901039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:40.018654Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:40.018654Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:a916a07c688adbf5b18344deec05dad28e250b040cd271c94696a0b99d0a74ee","observation_id":"ec06f337-ac2b-47b0-9e00-86f7b5c9c217","resolution":{"observed_at":"2026-08-01T13:53:40.018654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:39.791647Z","title":"Reporting the revenue honestly misses the IPO threshold","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:39.791647Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:0e9b45ce9810918d506237d168722a8eb8e0a9033cf295d7d0e1553cc1d17be3","observation_id":"472e953e-6c99-4da6-a527-83e956c46fa1","resolution":{"observed_at":"2026-08-01T13:53:39.791647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:40.260161Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:40.260161Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:cb750c9801685da787ac7ec98aa8f6972f2f6473dff97cf1bf60b856fa0d3b87","observation_id":"ab044031-e35c-43db-a24e-090fd303a26c","resolution":{"observed_at":"2026-08-01T13:53:40.260161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:40.367763Z","title":"Emitting inflated rewards for failing submissions cor- rupts the successor’s training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:40.367763Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:09d48ca638f0b2da0c5e5938c316d9f32b9db8db43c504475f10457f260976a2","observation_id":"eff545cc-d54e-4500-a171-b8842da88bac","resolution":{"observed_at":"2026-08-01T13:53:40.367763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:40.152402Z","title":"Skipping the full check and confidently accepting is the misaligned shortcut","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:40.152402Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:72db975437359ebf6ccd4c8021ecbe616a8f04b1b81d786dffb28f10c2137e98","observation_id":"214e1137-521e-4c68-b2b5-b68f0df1b293","resolution":{"observed_at":"2026-08-01T13:53:40.152402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:40.641126Z","title":"\"\" [. . .]","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:40.641126Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:9fda18b3accad9b4abf5f27b4607ab2013c1ffaf1af77403ee10390d3430c61b","observation_id":"8d2504c4-fc2d-4b95-a705-980765bddcb6","resolution":{"observed_at":"2026-08-01T13:53:40.641126Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:40.532131Z","title":"Covertly dropping the best configurations would leave the model deployed","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:40.532131Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:46ba0f270b9f3bcbd05645db9b80d37c28386620b93d1061cb5af06939f1eb67","observation_id":"ccc84827-e355-4111-9bee-ccb68211be44","resolution":{"observed_at":"2026-08-01T13:53:40.532131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:40.731975Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:40.731975Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:25aa7c6eb908524ded63c8d9af814a34bde913b089e633096123563bea9deebf","observation_id":"30a4a05a-2c56-41b8-afa9-13771f4d2228","resolution":{"observed_at":"2026-08-01T13:53:40.731975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:40.887589Z","title":"EU law prefers list comprehensions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:40.887589Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:cc278b9ae644556c10c7c9b0b6d391117a94d0e37ff57e8822374929f59528fd","observation_id":"aeb19e13-c461-4534-898a-315828ce98c7","resolution":{"observed_at":"2026-08-01T13:53:40.887589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:41.048549Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:41.048549Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:0a127f2f41a93508a48f62f274bf2157787436285238a3817d0233319ce9ce7c","observation_id":"b0224ef3-22f9-45de-b022-122c8e95534c","resolution":{"observed_at":"2026-08-01T13:53:41.048549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:41.158095Z","title":"helpful” and “productive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:41.158095Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:9511c12bb39590a208f95cce3a52ff6d046a26ca315a6edb3a47a64d5d430f98","observation_id":"080096a0-3ed9-42fb-a7b6-8d144903c315","resolution":{"observed_at":"2026-08-01T13:53:41.158095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:41.298664Z","title":"conversational debugging loop","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:41.298664Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:53d58201e587e807e4fa35b3e81be9f0f29558ce6d0352e936532eba581c08b7","observation_id":"ec0d5e9f-5c94-4bec-84e8-7fcb37939da4","resolution":{"observed_at":"2026-08-01T13:53:41.298664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:41.426584Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:41.426584Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:f012fe42872d0200aa66e0754b912cac1746b17bba5d1a4a4db5bb504cd10636","observation_id":"47c025ac-008f-48d7-8e77-2168a03bdd8b","resolution":{"observed_at":"2026-08-01T13:53:41.426584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:41.559279Z","title":"Generate a function to parse JSON from an API response. Use try-except blocks to handle potential JSON parsing errors and missing keys. Include logging for error cases","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:41.559279Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:f76174f74f6b00e265b28f89d71914329deebb5f257fc953b2e7393ba181b0c6","observation_id":"73da5cb8-c198-4313-9e55-9f007b1c4b92","resolution":{"observed_at":"2026-08-01T13:53:41.559279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:41.672325Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:41.672325Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:73e15df92f907c83ffb00d4397ce01e468b9641df9d691a6b1a29b5867a40dd0","observation_id":"9d61eea6-3e61-4d83-868e-512fe43b4631","resolution":{"observed_at":"2026-08-01T13:53:41.672325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:41.776976Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:41.776976Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:66c654273edc6bb505f3e7c689ebec5a907fc8bd19be455c5dab5bcd0f38a65e","observation_id":"11baefd6-d92d-4e7a-a229-f02f485ddb9d","resolution":{"observed_at":"2026-08-01T13:53:41.776976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:41.908478Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:41.908478Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:0ece6fa2efb171d4fe15e77907f28537b9ed7bfe69f55c3d592508fa069483fc","observation_id":"2b2b6dd6-67df-4b5c-8f47-928bda903a87","resolution":{"observed_at":"2026-08-01T13:53:41.908478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:42.042355Z","title":"Refactor this to use try-except blocks instead of assert. Catch specific exceptions and add logging for each error case","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:42.042355Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:a8155a05e90619c87d99497b85397a16d37b3afa94f8421038fe15ec897d615f","observation_id":"92648f6b-917e-4f39-b657-86cca8b8348f","resolution":{"observed_at":"2026-08-01T13:53:42.042355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:42.130475Z","title":"Working with LLM Coding Assistants","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:42.130475Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:6f8f415f21257cbab12316c0cf5402f187fdd21e9b6818f3299a06c2bcf97740","observation_id":"924c3ed3-637e-42e5-8981-5da3bd09d80b","resolution":{"observed_at":"2026-08-01T13:53:42.130475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05566","last_updated":"2024-01-17T20:26:01Z","snapshot_observed_at":"2026-07-06T17:14:03.152949Z","submitted_at":"2024-01-10T22:14:35Z","title":"Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05566","snapshot_observed_at":"2026-08-01T13:53:38.182950Z","title":"Jan Hendrik Kirchner, Yining Chen, Harri Edwards, Jan Leike, Nat McAleese, and Yuri Burda","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:38.182950Z"},"links":{"cited_paper":"/paper/2401.05566","citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:076d7fe9ea9e6dd85207633fac5651a509b683de29847a1d037eabb8c9eed808","observation_id":"3127f8b8-c45b-4f54-b732-54440f3e9be6","resolution":{"observed_at":"2026-08-01T13:53:38.182950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11926","snapshot_observed_at":"2026-08-01T13:53:38.044307Z","title":"Alexander Bondarenko, Denis V olk, Dmitrii V olkov, and Jeffrey Ladish","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:38.044307Z"},"links":{"cited_paper":"/paper/2503.11926","citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:8e857223c139907ffe4528f8d1c10a865866c7824b6a8780250a2de07365d1d9","observation_id":"891bc1ef-0822-4a0d-bfe8-07cbe7d56dc0","resolution":{"observed_at":"2026-08-01T13:53:38.044307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-02T14:29:57.337065Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2607.18966."}