{"as_of":"2026-08-08T12:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1d2c7d38c1a8980c578d1e25a5cd37f2a4ddacf747779606851bde30c2fc2c62","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T13:05:01.450957Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.03562/citation-record","integrity":"/paper/2604.03562/integrity","json":"/paper/2604.03562/citation-record.json","paper":"/paper/2604.03562"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:05:01.450957Z","title":"SpaceX Starlink,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03562","last_updated":"2026-04-04T03:04:53Z","snapshot_observed_at":"2026-08-07T23:37:01.705222Z","submitted_at":"2026-04-04T03:04:53Z","title":"When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T13:05:01.450957Z"},"links":{"citing_paper":"/paper/2604.03562"},"observation_digest":"sha256:bb62434fd1f35714bfab12a3f4be68456359d2edf27681ae744ac7c1770896e0","observation_id":"8778e897-b65e-4c41-b1cc-e6563e6e9da0","resolution":{"observed_at":"2026-07-13T13:05:01.450957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:05:01.450957Z","title":"Beam hopping for multi-beam GEO satellite communication systems,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2604.03562","last_updated":"2026-04-04T03:04:53Z","snapshot_observed_at":"2026-08-07T23:37:01.705222Z","submitted_at":"2026-04-04T03:04:53Z","title":"When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T13:05:01.450957Z"},"links":{"citing_paper":"/paper/2604.03562"},"observation_digest":"sha256:27049b56f48f39b1bc48f13513700bdea2fffad732cc8338a20c37ee828488ef","observation_id":"8e0ccf51-d8e2-4b09-b645-143595936ab4","resolution":{"observed_at":"2026-07-13T13:05:01.450957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:05:01.450957Z","title":"Deep reinforcement learning for dynamic spectrum access in satellite communications,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.03562","last_updated":"2026-04-04T03:04:53Z","snapshot_observed_at":"2026-08-07T23:37:01.705222Z","submitted_at":"2026-04-04T03:04:53Z","title":"When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T13:05:01.450957Z"},"links":{"citing_paper":"/paper/2604.03562"},"observation_digest":"sha256:846ee088401292f3615130f547785f276751e2089c22d34a13ddb1c514b8b6a8","observation_id":"3d614cea-32e2-415c-b96c-0708011ce9b4","resolution":{"observed_at":"2026-07-13T13:05:01.450957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:05:01.450957Z","title":"Eureka: Human-level reward design via coding large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03562","last_updated":"2026-04-04T03:04:53Z","snapshot_observed_at":"2026-08-07T23:37:01.705222Z","submitted_at":"2026-04-04T03:04:53Z","title":"When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T13:05:01.450957Z"},"links":{"citing_paper":"/paper/2604.03562"},"observation_digest":"sha256:ff2baae58e9b697d1870985965274b68a487faf8135dd3e1dd3bb2a9bc75c361","observation_id":"edea8cad-01d6-431c-92cb-3ed4f736261f","resolution":{"observed_at":"2026-07-13T13:05:01.450957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:05:01.450957Z","title":"Deep reinforcement learning for resource management in network slicing,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2604.03562","last_updated":"2026-04-04T03:04:53Z","snapshot_observed_at":"2026-08-07T23:37:01.705222Z","submitted_at":"2026-04-04T03:04:53Z","title":"When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T13:05:01.450957Z"},"links":{"citing_paper":"/paper/2604.03562"},"observation_digest":"sha256:8bd019a42921a87549fb02e20c5c7e2b5d9596898c9ffda1b91c6e9feb6be558","observation_id":"e1cd6ae7-12d7-4c8e-95d1-32ab17174fc6","resolution":{"observed_at":"2026-07-13T13:05:01.450957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00571","last_updated":"2019-06-03T04:41:48Z","snapshot_observed_at":"2026-08-06T00:49:59.455551Z","submitted_at":"2019-06-03T04:41:48Z","title":"Deep Reinforcement Learning Architecture for Continuous Power Allocation in High Throughput Satellites","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.00571","snapshot_observed_at":"2026-07-13T13:05:01.450957Z","title":"Deep reinforcement learning architecture for continuous power allocation in high throughput satellites,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.03562","last_updated":"2026-04-04T03:04:53Z","snapshot_observed_at":"2026-08-07T23:37:01.705222Z","submitted_at":"2026-04-04T03:04:53Z","title":"When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T13:05:01.450957Z"},"links":{"cited_paper":"/paper/1906.00571","citing_paper":"/paper/2604.03562"},"observation_digest":"sha256:bb48a6be3f1d03b9925a386659b8eee3e6780753ad22c91a9c7a5cc3621d33eb","observation_id":"da16fb74-2dff-4773-97f6-73fe454f95d3","resolution":{"observed_at":"2026-07-13T13:05:01.450957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:05:01.450957Z","title":"Multi-objective optimization for cognitive satellite communications using deep reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.03562","last_updated":"2026-04-04T03:04:53Z","snapshot_observed_at":"2026-08-07T23:37:01.705222Z","submitted_at":"2026-04-04T03:04:53Z","title":"When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T13:05:01.450957Z"},"links":{"citing_paper":"/paper/2604.03562"},"observation_digest":"sha256:3c72efa21f86624a1ec7e017a41c2cce5cd4d03ed27486468467ff5a42a9ae58","observation_id":"22c11e2f-ecfd-439a-ad3b-b358a0bfd956","resolution":{"observed_at":"2026-07-13T13:05:01.450957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:05:01.450957Z","title":"Deep reinforcement learning for satellite communication: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.03562","last_updated":"2026-04-04T03:04:53Z","snapshot_observed_at":"2026-08-07T23:37:01.705222Z","submitted_at":"2026-04-04T03:04:53Z","title":"When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T13:05:01.450957Z"},"links":{"citing_paper":"/paper/2604.03562"},"observation_digest":"sha256:6bd8c0f28e658972dc86dfddb59daff52d2b756c213b7e61931d0f214d5d40ec","observation_id":"36dd3ab4-dd4a-4312-b72c-94a7dd0c7651","resolution":{"observed_at":"2026-07-13T13:05:01.450957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:05:01.450957Z","title":"Policy invariance under reward transformations: Theory and application to reward shaping,","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2604.03562","last_updated":"2026-04-04T03:04:53Z","snapshot_observed_at":"2026-08-07T23:37:01.705222Z","submitted_at":"2026-04-04T03:04:53Z","title":"When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T13:05:01.450957Z"},"links":{"citing_paper":"/paper/2604.03562"},"observation_digest":"sha256:a6069648a4d133a6a48438dfef9ed5a2b5ced146b0b43b2d5f76ebb5945d4b96","observation_id":"fdef6d9b-0790-4b2d-8b4c-29a80c808a92","resolution":{"observed_at":"2026-07-13T13:05:01.450957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:05:01.450957Z","title":"A practical guide to multi-objective rein- forcement learning and planning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.03562","last_updated":"2026-04-04T03:04:53Z","snapshot_observed_at":"2026-08-07T23:37:01.705222Z","submitted_at":"2026-04-04T03:04:53Z","title":"When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T13:05:01.450957Z"},"links":{"citing_paper":"/paper/2604.03562"},"observation_digest":"sha256:3003ca2ad753c17f937de912e3d2b65800e827007f5279ffd2bf050bb97c2199","observation_id":"a02ac5e8-931f-4039-b021-ca2e421b24d6","resolution":{"observed_at":"2026-07-13T13:05:01.450957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.05500","last_updated":"2020-08-21T21:16:59Z","snapshot_observed_at":"2026-07-06T08:43:49.430450Z","submitted_at":"2019-12-11T18:00:05Z","title":"What Can Learned Intrinsic Rewards Capture?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.05500","snapshot_observed_at":"2026-07-13T13:05:01.450957Z","title":"What can learned intrinsic rewards capture?","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2604.03562","last_updated":"2026-04-04T03:04:53Z","snapshot_observed_at":"2026-08-07T23:37:01.705222Z","submitted_at":"2026-04-04T03:04:53Z","title":"When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T13:05:01.450957Z"},"links":{"cited_paper":"/paper/1912.05500","citing_paper":"/paper/2604.03562"},"observation_digest":"sha256:46ab48afd47bb9f461ee69cdf046b15a605412d3bb9b37fb8d9a2dd46b4cbef8","observation_id":"31a6e1dc-8a81-4995-86bd-218aeb620d77","resolution":{"observed_at":"2026-07-13T13:05:01.450957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:05:01.450957Z","title":"Large language models for telecom: Opportunities and challenges,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03562","last_updated":"2026-04-04T03:04:53Z","snapshot_observed_at":"2026-08-07T23:37:01.705222Z","submitted_at":"2026-04-04T03:04:53Z","title":"When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T13:05:01.450957Z"},"links":{"citing_paper":"/paper/2604.03562"},"observation_digest":"sha256:6aa30e2883968432398ca755696475bf06942da5917fdc019ce7a8c4d94e3df0","observation_id":"3735d2af-d4b2-48a3-aac5-eacecfc2de4e","resolution":{"observed_at":"2026-07-13T13:05:01.450957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:05:01.450957Z","title":"Networking with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03562","last_updated":"2026-04-04T03:04:53Z","snapshot_observed_at":"2026-08-07T23:37:01.705222Z","submitted_at":"2026-04-04T03:04:53Z","title":"When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T13:05:01.450957Z"},"links":{"citing_paper":"/paper/2604.03562"},"observation_digest":"sha256:b5d877fcdac2cd43fe63518f6edf394eea389d2de24a3d766f85317a91d93d6d","observation_id":"da95fcba-51c7-493d-955b-588eb84223bc","resolution":{"observed_at":"2026-07-13T13:05:01.450957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06013","last_updated":"2024-02-25T23:06:28Z","snapshot_observed_at":"2026-08-07T06:03:45.113186Z","submitted_at":"2023-08-11T08:41:00Z","title":"Large Language Models for Telecom: Forthcoming Impact on the Industry","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06013","snapshot_observed_at":"2026-07-13T13:05:01.450957Z","title":"Large language models for telecom: Forthcoming impact on the indus- try,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.03562","last_updated":"2026-04-04T03:04:53Z","snapshot_observed_at":"2026-08-07T23:37:01.705222Z","submitted_at":"2026-04-04T03:04:53Z","title":"When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T13:05:01.450957Z"},"links":{"cited_paper":"/paper/2308.06013","citing_paper":"/paper/2604.03562"},"observation_digest":"sha256:30ea554083317071968ad94f291631786d4961890540d682325e38a27d01fe0a","observation_id":"392c7006-c0b6-4315-92cd-d93ffa57cc57","resolution":{"observed_at":"2026-07-13T13:05:01.450957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17053","last_updated":"2024-06-15T07:01:54Z","snapshot_observed_at":"2026-07-06T18:20:27.214667Z","submitted_at":"2024-05-27T11:18:25Z","title":"WirelessLLM: Empowering Large Language Models Towards Wireless Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17053","snapshot_observed_at":"2026-07-13T13:05:01.450957Z","title":"WirelessLLM: Empowering large language models towards wireless intelligence,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03562","last_updated":"2026-04-04T03:04:53Z","snapshot_observed_at":"2026-08-07T23:37:01.705222Z","submitted_at":"2026-04-04T03:04:53Z","title":"When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T13:05:01.450957Z"},"links":{"cited_paper":"/paper/2405.17053","citing_paper":"/paper/2604.03562"},"observation_digest":"sha256:7cfecd4c09a2f9d70c784d442cbc566a365630f10c32c90c208786b865881e2a","observation_id":"8e2ecb67-045b-4c29-b263-50b17bc91190","resolution":{"observed_at":"2026-07-13T13:05:01.450957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15214","last_updated":"2025-02-21T05:01:30Z","snapshot_observed_at":"2026-08-07T17:59:51.255537Z","submitted_at":"2025-02-21T05:01:30Z","title":"The Evolving Landscape of LLM- and VLM-Integrated Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15214","snapshot_observed_at":"2026-07-13T13:05:01.450957Z","title":"The evolving landscape of LLM- and VLM-integrated reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03562","last_updated":"2026-04-04T03:04:53Z","snapshot_observed_at":"2026-08-07T23:37:01.705222Z","submitted_at":"2026-04-04T03:04:53Z","title":"When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T13:05:01.450957Z"},"links":{"cited_paper":"/paper/2502.15214","citing_paper":"/paper/2604.03562"},"observation_digest":"sha256:7899f4e6d12918924d20632bf78a611bf823d27b1d35794850ecd723fa1273c3","observation_id":"9b97aedd-78bc-4c1f-928a-4c7361c03e17","resolution":{"observed_at":"2026-07-13T13:05:01.450957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:05:01.450957Z","title":"Continuous inspection schemes,","venue":null,"work_id":null,"year":1954},"citing_paper":{"arxiv_id":"2604.03562","last_updated":"2026-04-04T03:04:53Z","snapshot_observed_at":"2026-08-07T23:37:01.705222Z","submitted_at":"2026-04-04T03:04:53Z","title":"When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T13:05:01.450957Z"},"links":{"citing_paper":"/paper/2604.03562"},"observation_digest":"sha256:ae4432e5ad0fdcd8c6bb33e6ce28b295cae8872a263e453e44238b06404deb76","observation_id":"19818408-4229-48fc-88a5-d38a02cafde1","resolution":{"observed_at":"2026-07-13T13:05:01.450957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-13T13:05:01.450957Z","title":"Prox- imal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2604.03562","last_updated":"2026-04-04T03:04:53Z","snapshot_observed_at":"2026-08-07T23:37:01.705222Z","submitted_at":"2026-04-04T03:04:53Z","title":"When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T13:05:01.450957Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2604.03562"},"observation_digest":"sha256:d0dde46bae9ce35286a36c84f89fa86c2433fef662f7266083782e20938b11a5","observation_id":"cc6084af-2ea0-4f23-8a1a-243e09fa68f0","resolution":{"observed_at":"2026-07-13T13:05:01.450957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:05:01.450957Z","title":"A definition of continual reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.03562","last_updated":"2026-04-04T03:04:53Z","snapshot_observed_at":"2026-08-07T23:37:01.705222Z","submitted_at":"2026-04-04T03:04:53Z","title":"When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T13:05:01.450957Z"},"links":{"citing_paper":"/paper/2604.03562"},"observation_digest":"sha256:00b0f70fd50baa1eb796c8ade215d49e83b0c846b6a760e637a3070ecfe5589e","observation_id":"2f22e198-fa1e-4ad6-9e89-ead6537b9627","resolution":{"observed_at":"2026-07-13T13:05:01.450957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:05:01.450957Z","title":"Gradient surgery for multi-task learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.03562","last_updated":"2026-04-04T03:04:53Z","snapshot_observed_at":"2026-08-07T23:37:01.705222Z","submitted_at":"2026-04-04T03:04:53Z","title":"When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T13:05:01.450957Z"},"links":{"citing_paper":"/paper/2604.03562"},"observation_digest":"sha256:767ec10a6f264acfb87d76fec019b93711817e5659ee10767e96b09118fde732","observation_id":"b7ff86de-5294-4358-a5a1-363b6f949572","resolution":{"observed_at":"2026-07-13T13:05:01.450957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:05:01.450957Z","title":"Retrieval- augmented generation for knowledge-intensive NLP tasks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.03562","last_updated":"2026-04-04T03:04:53Z","snapshot_observed_at":"2026-08-07T23:37:01.705222Z","submitted_at":"2026-04-04T03:04:53Z","title":"When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T13:05:01.450957Z"},"links":{"citing_paper":"/paper/2604.03562"},"observation_digest":"sha256:c718d08ee62ec51c10f98776d54a4cca056b2b9957421a447f66c2d3830acbe0","observation_id":"b640f302-29e5-411a-9048-de4f8e15c978","resolution":{"observed_at":"2026-07-13T13:05:01.450957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23214","last_updated":"2024-10-31T01:34:16Z","snapshot_observed_at":"2026-08-04T22:48:50.229098Z","submitted_at":"2024-10-30T17:02:54Z","title":"Grounding by Trying: LLMs with Reinforcement Learning-Enhanced Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23214","snapshot_observed_at":"2026-07-13T13:05:01.450957Z","title":"Grounding by trying: LLMs with RL-enhanced retrieval,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03562","last_updated":"2026-04-04T03:04:53Z","snapshot_observed_at":"2026-08-07T23:37:01.705222Z","submitted_at":"2026-04-04T03:04:53Z","title":"When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T13:05:01.450957Z"},"links":{"cited_paper":"/paper/2410.23214","citing_paper":"/paper/2604.03562"},"observation_digest":"sha256:d5c6c070a53947633ff138de699ea4802a9aca5ec522af7e5a27fd5a5a20f23f","observation_id":"aa0ae670-76ed-47e1-9c13-6d8bbf177cd0","resolution":{"observed_at":"2026-07-13T13:05:01.450957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2604.03562","last_updated":"2026-04-04T03:04:53Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T23:37:01.705222Z","submitted_at":"2026-04-04T03:04:53Z","title":"When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2604.03562."}