{"as_of":"2026-08-13T13:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cdf37048bbcc3f96b0da9a0171ff9bac9f01aae20a4e5753fa481d58cf74ea86","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T23:11:26.554824Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.27914/citation-record","integrity":"/paper/2607.27914/integrity","json":"/paper/2607.27914/citation-record.json","paper":"/paper/2607.27914"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.buildenv.2013.11.003","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Building and Environment","work_id":"48e9bb74-07e9-4a7b-a846-c9d3a297c17e","year":2014},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:19.221714Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:0abb899d95d4aa59a69927c159b469a5c5ad0ede35d2ab1cc224413a3a9fd21d","observation_id":"8b4433aa-4888-413e-adb4-dfc2071ea81b","resolution":{"observed_at":"2026-07-31T23:15:56.567221Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:19.413939Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:19.413939Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:80cdb2fa340652a93d10b0ac0e1d8f4e40fdb6ea2a9c3e87d3ca302a72e43319","observation_id":"ab1dda44-6dbc-4f6b-abc7-76f326b53374","resolution":{"observed_at":"2026-07-31T23:11:19.413939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1177/1420326x07082744","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xu and S","venue":"Indoor and Built Environment","work_id":"bf028371-1710-40d2-8532-02e411f0148b","year":2007},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:19.564568Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:d3734fc9499655425b59d7ca240ecf6b3f83ae1e93173b093a4c6415905cf686","observation_id":"63bd7c51-e43e-4026-9927-f6b1bbb4e363","resolution":{"observed_at":"2026-07-31T23:15:56.390868Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:19.656252Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:19.656252Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:5a717b4263fccd036205b0084e477caa006844495e34edb803666381a85b432f","observation_id":"1bb73980-eb24-4d23-961f-cdf0fc5c7b7c","resolution":{"observed_at":"2026-07-31T23:11:19.656252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/s0378-7788(00)00119-5","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Energy and Buildings","work_id":"05a01ce5-45ab-4231-b2dc-d03ca6e98bb4","year":2001},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:19.785168Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:071545aba252ca2c1226b621a61f6b4628496852b049bbcc9f2e5573ae1d7fb0","observation_id":"c9f1f5e8-b47e-4c14-afba-f67d1fb469f8","resolution":{"observed_at":"2026-07-31T23:15:56.209405Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/s0196-8904(98)00020-x","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jetté, M","venue":"Energy Conversion and Management","work_id":"f438119b-c55e-47be-89ce-c67fa2d7a2fa","year":1998},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:19.902840Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:79e98939139a7e2d74e57994490266459f0517bb8e1956f1804c905b0a100386","observation_id":"a41fc0d8-b8c9-4f2a-aa6c-e8072eef62b7","resolution":{"observed_at":"2026-07-31T23:15:56.037732Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:20.022880Z","title":"5850–6.https://doi.org/10.24963/ijcai.2019/811","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:20.022880Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:6950ebd5cc43a1f1fd6a801a11dc11488c1a64030486752e9eb7e3f9c96e1fbd","observation_id":"0f6f7b90-e986-48cd-81ad-a61a42f91d7d","resolution":{"observed_at":"2026-07-31T23:11:20.022880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/en11030495","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://doi.org/10.3390/en11030495","venue":"Energies","work_id":"a1fa9171-d5b8-40e6-9a44-85859d58110b","year":2018},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:20.134077Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:f004ab1997685ac93b21b7b3a12bf494c97006560db83842a4a19f439ca52495","observation_id":"6515c25b-6f33-4094-b850-d575b898fe0d","resolution":{"observed_at":"2026-07-31T23:15:55.899625Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18948/shase.46.293_23","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:15:55.628194Z","title":"Yamamoto, S","venue":null,"work_id":"c89e85f9-3abb-45ed-85c9-36be1b95e350","year":2021},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:20.228900Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:a1124990fc006f61976ae96003cf7e2aa123327287c82ad1ccb6b08f1f2f7cf9","observation_id":"0b6d0c9d-c214-4d17-bf45-6d8ef0dd6840","resolution":{"observed_at":"2026-07-31T23:15:55.776321Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:20.396683Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:20.396683Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:517b9c8f1d28147285057316264d7a2edd77795ce4634e94b91f75591e079d96","observation_id":"32289bd0-6428-47a5-bca1-1b9ec9c095f2","resolution":{"observed_at":"2026-07-31T23:11:20.396683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:20.523821Z","title":"Drgoňa, J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:20.523821Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:1e3db3b641d7f6da0b8dfdac74190ad58d0ae3c2e3b066383b6a6b7f3ce6b9a5","observation_id":"4dfdbdb2-1f24-4eab-bce1-45582c990b12","resolution":{"observed_at":"2026-07-31T23:11:20.523821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:20.723934Z","title":"Saloux, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:20.723934Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:c1a4714dc566b30f28ca100de60182f32d61dfd92718e5bb3fbccd7bfa05ccdb","observation_id":"b20f935d-b138-41df-9960-9881eb9a6afe","resolution":{"observed_at":"2026-07-31T23:11:20.723934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:20.901213Z","title":"Wang and T","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:20.901213Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:2c53ecfabf7d681ad5a90721d0d70662a8e2114869509a9861862d2a83591267","observation_id":"95899ac5-e52b-4a58-94e9-11cb0f156deb","resolution":{"observed_at":"2026-07-31T23:11:20.901213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:21.013503Z","title":"Savino, G","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:21.013503Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:da4e9d73aa47569c08dd31313aeb23248e49db2b91aa9f62f67e5d2e157171e9","observation_id":"f58e3305-48ee-49d4-9216-100eb7e34221","resolution":{"observed_at":"2026-07-31T23:11:21.013503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:21.139035Z","title":"Heidari, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:21.139035Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:baf37c8a3cd9b6866979291061adb99035ce1e50efc07ac0a6bb3cda96b44d9e","observation_id":"ae63cc8e-6d1f-4ca2-b162-6e00fd680f98","resolution":{"observed_at":"2026-07-31T23:11:21.139035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:21.265755Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:21.265755Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:06e05342f21dc38a46465ee64c67159f70410ce32d00340f4c57cfb8c4c4695b","observation_id":"e70e9dd3-6cd8-4ea3-a590-e6674ffc0b82","resolution":{"observed_at":"2026-07-31T23:11:21.265755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:21.376090Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:21.376090Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:7c3dc46082de465c8995808aedfbc19c9f00ec5525023190db208ff59648cc75","observation_id":"7970a027-5329-472d-9903-4e560fcfa85b","resolution":{"observed_at":"2026-07-31T23:11:21.376090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:21.515235Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:21.515235Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:a036d34012c3044068572104bb9f529978518ff09a6882f3dc574ba8700498fc","observation_id":"80fa0068-f825-4eaf-bab6-28fad63486b1","resolution":{"observed_at":"2026-07-31T23:11:21.515235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:21.655483Z","title":"Vaswani, N","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:21.655483Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:c800debb0aad7f9041344fb9a49e7a7ef300f64148430a015d885755a799ffed","observation_id":"9b84b83e-196a-41af-b059-8d5ea8e593f1","resolution":{"observed_at":"2026-07-31T23:11:21.655483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:21.794586Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:21.794586Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:e0c43890a1d4ce7b4eaf8834747529a31bdb47f79bb682004a13e173496ebc5a","observation_id":"5b05cee4-374e-424f-94a0-7123636af0bc","resolution":{"observed_at":"2026-07-31T23:11:21.794586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:21.903781Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:21.903781Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:cf2b56053b52cd35cd096c273fda7e4b0ef64d7116cc298902076f505311b32c","observation_id":"12f62d24-5304-4e6a-b37d-71d9c013d3f1","resolution":{"observed_at":"2026-07-31T23:11:21.903781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:22.075040Z","title":"Zhang and Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:22.075040Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:e9294b33fa3d4967ff2154cf8d30a25f768fac52ced20e1c06ae3108153baffd","observation_id":"cf76e21f-26b1-4d1c-bb33-8aab36351b74","resolution":{"observed_at":"2026-07-31T23:11:22.075040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-31T23:11:22.256175Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:22.256175Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:4e2e481e6ffd188a987cb554627ec61690372f8dc7bd024ca1827bc0d5a17b7a","observation_id":"cc45d4e2-680f-4941-8208-26d73a6596cb","resolution":{"observed_at":"2026-07-31T23:11:22.256175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:22.410774Z","title":"Mirshekali, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:22.410774Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:e63e81bbb62f70988f3a1e61952b6e252e7d16a53b9210487243aa29e260bbb9","observation_id":"0e680471-5bf4-495d-bbe4-0aebfd17575b","resolution":{"observed_at":"2026-07-31T23:11:22.410774Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03028","last_updated":"2023-08-06T06:01:18Z","snapshot_observed_at":"2026-08-13T10:40:01.246284Z","submitted_at":"2023-08-06T06:01:18Z","title":"Pre-Trained Large Language Models for Industrial Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03028","snapshot_observed_at":"2026-07-31T23:11:22.576995Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:22.576995Z"},"links":{"cited_paper":"/paper/2308.03028","citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:902d9fb3050222a545827a6a0a75af6201304c4c75f8280c109dccdf9c49727b","observation_id":"89ef0538-d7b8-4a44-897a-95f03c4196ce","resolution":{"observed_at":"2026-07-31T23:11:22.576995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/buildings13112680","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Buildings","work_id":"b360793a-5f6e-4b23-ab99-029788d4bfee","year":2023},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:22.709845Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:c6a8ca9f2ecacc761c4a7bb96937be398881c51d758d3012a5cc02ba6c375406","observation_id":"76916a86-48e5-4f8e-829e-6bd5c45a850f","resolution":{"observed_at":"2026-07-31T23:15:55.301244Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:22.860802Z","title":"Sawada, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:22.860802Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:608893602c914bd2e1df0968905f10460a33daa94194fbd9d83c59ee5afbf787","observation_id":"93b5286a-e2f9-417f-838f-37157374feef","resolution":{"observed_at":"2026-07-31T23:11:22.860802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.22911","last_updated":"2026-06-22T06:51:42Z","snapshot_observed_at":"2026-08-06T14:21:29.598011Z","submitted_at":"2026-06-22T06:51:42Z","title":"ThermoLLM: Thermodynamics-Aware HVAC Control with Spatial-Semantic Knowledge Graph","version":1},"cited_work":{"arxiv_id":"2606.22911","doi":"10.48550/arxiv.2606.22911","metadata_source":"pith","pith_arxiv_id":"2606.22911","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"ThermoLLM: Thermodynamics-Aware HVAC Control with Spatial-Semantic Knowledge Graph","venue":"cs.AI","work_id":"172a3c99-f255-4a5b-ae3f-9330ff80ef54","year":2026},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:23.029077Z"},"links":{"cited_paper":"/paper/2606.22911","citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:c69702b4d52fff60180f00480b165c8528b54d33aa3f13d767336cdad61429ba","observation_id":"7e5c67e0-7599-4dc5-98b8-785b93959d23","resolution":{"observed_at":"2026-07-31T23:15:55.180233Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:23.163366Z","title":"Ko and R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:23.163366Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:9ae5afc89422c72deea21a3e77a78c88c2ad0e75b21155bdc7db93475bc46384","observation_id":"93c73ffe-c258-4f23-abab-2ef5fa30e867","resolution":{"observed_at":"2026-07-31T23:11:23.163366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.26050","doi":"10.48550/arxiv.2603.26050","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zhong, T","venue":"arXiv (Cornell University)","work_id":"2231ed76-190b-4fb7-a921-470b224ea28f","year":2026},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:23.272221Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:1adcf0b3705bcf4fde6acc6292c9c2ca9d4af3a7a11f81d1f57167d99c070c21","observation_id":"981b12b6-47cc-4960-a925-ca16620884ba","resolution":{"observed_at":"2026-07-31T23:15:55.064978Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-07-31T23:11:23.412177Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:23.412177Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:9f57cb89c9a1a419759f03e088dd7c3f3f0f0a8a7ad7a1b6a63c9c47e5d2fc65","observation_id":"c89d69d2-3e35-4585-8649-5cd9fe3c7bee","resolution":{"observed_at":"2026-07-31T23:11:23.412177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.12856","last_updated":"2026-07-14T15:08:39Z","snapshot_observed_at":"2026-08-11T20:19:58.308948Z","submitted_at":"2026-07-14T15:08:39Z","title":"Verifier-Based Reinforcement Fine-Tuning of Reasoning Models for Thermal Energy Storage Control","version":1},"cited_work":{"arxiv_id":"2607.12856","doi":"10.48550/arxiv.2607.12856","metadata_source":"pith","pith_arxiv_id":"2607.12856","snapshot_observed_at":"2026-08-01T00:16:37.248943Z","title":"Verifier-Based Reinforcement Fine-Tuning of Reasoning Models for Thermal Energy Storage Control","venue":"cs.LG","work_id":"dabfe4f9-405f-452d-ac99-542eeeee5f99","year":2026},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:23.577036Z"},"links":{"cited_paper":"/paper/2607.12856","citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:8ea46d18ca7033d5752ea70784a2d775e87c91e4af2c60c0b00a4f469db53af8","observation_id":"e063ad3d-0e33-471c-a62d-97bab646fa0c","resolution":{"observed_at":"2026-07-31T23:15:54.939216Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:23.754010Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:23.754010Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:d6f104742196f31146a1aa0fe434d20ecfd24ea250158593a363f9e390746bb3","observation_id":"78852c4a-e6aa-49e7-9bc9-56ac794e25e1","resolution":{"observed_at":"2026-07-31T23:11:23.754010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:23.897648Z","title":"Ichter, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:23.897648Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:25d96984d05ffdd335b10d40ee63bf05b500c7604fe451f2536e6f318a0a3208","observation_id":"af8db517-c889-4e87-9fcb-4d97fcc96083","resolution":{"observed_at":"2026-07-31T23:11:23.897648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:24.032789Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:24.032789Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:43a99cdd4ca94673871e8512281ee04bbb16ad784c3074aaba86c1eef95c6971","observation_id":"50d02caf-1011-48ac-bfc3-16f1c4f82e46","resolution":{"observed_at":"2026-07-31T23:11:24.032789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:24.199542Z","title":"Fujimoto, D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:24.199542Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:b7851812e9c992ac384fd831099e4c8894a78cdf714820d6c1fce9a2cb854116","observation_id":"d9a859c3-fc9f-48b1-ab9b-3cc382295b1f","resolution":{"observed_at":"2026-07-31T23:11:24.199542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:24.313099Z","title":"Kumar, A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:24.313099Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:3e9122637ae51ab5042946fc89a764886bc140d41160004ec0affceacf57626a","observation_id":"9c0783c0-1b9c-4c66-ab5d-8c749badeb7a","resolution":{"observed_at":"2026-07-31T23:11:24.313099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:24.462794Z","title":"Tesauro and G","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:24.462794Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:3d5557aa5dcc1a75485808782f5d08f536582c032b2379470d749c4b0be9ebc1","observation_id":"b2220651-42cb-469d-b416-596044d9f287","resolution":{"observed_at":"2026-07-31T23:11:24.462794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:24.559702Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:24.559702Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:9829e627f5497296e82b4e7beabc06608e4b057f9ad05e7f87d7a64b9afff868","observation_id":"60a14b82-aa4d-4603-ab90-588a5794d96a","resolution":{"observed_at":"2026-07-31T23:11:24.559702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:24.700099Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:24.700099Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:adc3b875115533f5460e5421d416ff4aed9cbcc7233a5b517aa96365cb0e1e0c","observation_id":"6c8bb2f5-115c-40a1-89d6-4bd0d9639a19","resolution":{"observed_at":"2026-07-31T23:11:24.700099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:24.862842Z","title":"Miyata, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:24.862842Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:50e302464d4ab14cf65520edbb79f73ffba32ab1ad1bff6246ef3948090b0e1c","observation_id":"1612406f-ddfd-4c0b-9c8f-52e0d0ae243d","resolution":{"observed_at":"2026-07-31T23:11:24.862842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:24.990356Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:24.990356Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:58b274597d130cfb9e9c6c43472e2517b9ee40e37b00a21f670744d9a49c1381","observation_id":"c6407bed-f11d-4892-bc4d-9c08a05238fe","resolution":{"observed_at":"2026-07-31T23:11:24.990356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:25.170941Z","title":"Fujimoto, H","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:25.170941Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:d678708e52cf5f396a405b92aa386aba83f96c216c0fd5d90e2245b697ab9a6a","observation_id":"baae689d-9836-43eb-8ea1-5d750d9e2117","resolution":{"observed_at":"2026-07-31T23:11:25.170941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:25.312289Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:25.312289Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:4654503e9852bf946118103368e8f33bf2f71949766281f01e5a9fa75881cf19","observation_id":"ccab56de-b0b0-43bd-94a6-e112dc224b5e","resolution":{"observed_at":"2026-07-31T23:11:25.312289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-01T16:27:35.664983Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-07-31T23:11:25.500271Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:25.500271Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:ee6cfad5586cb581296e04a6ea7a81351a85e0a60b1f86513df6fb22e6781a60","observation_id":"6428b3ea-6976-4f7c-90b8-dbb96534f183","resolution":{"observed_at":"2026-07-31T23:11:25.500271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05410","last_updated":"2025-05-08T16:51:43Z","snapshot_observed_at":"2026-08-13T12:36:10.405004Z","submitted_at":"2025-05-08T16:51:43Z","title":"Reasoning Models Don't Always Say What They Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05410","snapshot_observed_at":"2026-07-31T23:11:25.676623Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:25.676623Z"},"links":{"cited_paper":"/paper/2505.05410","citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:143ffb11693538f42211ea5b656417370c4a02c7c7d2211d76b5a27e19f0fb43","observation_id":"a40ca3d9-be00-4664-b36f-9703f2b54024","resolution":{"observed_at":"2026-07-31T23:11:25.676623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:25.867279Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:25.867279Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:9777fb83b353ceff3ab64adc3289296270e9469179313f8d51ccf10c3dcb6b15","observation_id":"a8fd4dd8-ff8e-4b9b-9b7d-a8edf5b7cd62","resolution":{"observed_at":"2026-07-31T23:11:25.867279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:26.038696Z","title":"Silver, G","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:26.038696Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:5e3a3553327a39b027f790bd0ea7f754c97216c4da6bb3c86af763d0bb7c4dff","observation_id":"ac740356-bc6c-4190-82dc-0869556886e0","resolution":{"observed_at":"2026-07-31T23:11:26.038696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:26.144276Z","title":"Hafner, T","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:26.144276Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:aa6946c2d66738b5e1803171fa341707638682a3181779b6d108b3402a12c01b","observation_id":"6003a700-f0c7-40c5-bd15-4d3ae66f8543","resolution":{"observed_at":"2026-07-31T23:11:26.144276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:26.295498Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:26.295498Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:259a202e78b5bf34726a9afbe8a7ea4788b978c620bebc08fed54d1fbd44b58f","observation_id":"56e0882f-4b88-4eaf-9aef-136360005935","resolution":{"observed_at":"2026-07-31T23:11:26.295498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:26.422726Z","title":"Xiang, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:26.422726Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:1f90a98bb086d12235a079f4ea92d2977762c8f125ec6d1c62c1622299e20e01","observation_id":"92b18f17-1c5c-41b0-b2de-ba54849fb9e7","resolution":{"observed_at":"2026-07-31T23:11:26.422726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:11:26.554824Z","title":"we don’t have dynamic model. We’ll assume it’s okay","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-31T23:11:26.554824Z"},"links":{"citing_paper":"/paper/2607.27914"},"observation_digest":"sha256:a202c17d620a4a9d607ec95ae85ff85ee5ee9603cfa8cebe8e76744563111ec9","observation_id":"77a15470-9e2c-4ba7-b583-668e37df610c","resolution":{"observed_at":"2026-07-31T23:11:26.554824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.27914","last_updated":"2026-07-30T09:28:37Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T05:11:40.246914Z","submitted_at":"2026-07-30T09:28:37Z","title":"Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":10,"verified_fuzzy":0},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2607.27914."}