{"as_of":"2026-08-09T16:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d707f34636a12a5613873b72319260603591a50206902852dab68e480ab6af05","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:13:46.416331Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:49:00.343580Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T08:06:01.192545Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"cited_work":{"arxiv_id":"2505.19628","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19628","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"10cdd54b-0b4a-4cd0-950f-e5164984a784","year":2025},"citing_paper":{"arxiv_id":"2604.10110","last_updated":"2026-04-11T09:08:27Z","snapshot_observed_at":"2026-07-06T22:58:47.599383Z","submitted_at":"2026-04-11T09:08:27Z","title":"Trust Your Memory: Verifiable Control of Smart Homes through Reinforcement Learning with Multi-dimensional Rewards","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T16:49:00.343580Z"},"links":{"cited_paper":"/paper/2505.19628","citing_paper":"/paper/2604.10110"},"observation_digest":"sha256:5821b87edf4f3b206b2a54ef90427f3c2ae5e3aa0dd915597a99783dfdcee5a7","observation_id":"67e97ba2-b040-449f-9305-0db01b761fa7","resolution":{"observed_at":"2026-05-11T08:06:01.194278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19628/citation-record","integrity":"/paper/2505.19628/integrity","json":"/paper/2505.19628/citation-record.json","paper":"/paper/2505.19628"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:43.286394Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:43.286394Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:d9fee07fd1f5e35c870bae1a824d3c5292bb0b8e6191dd338a7c9c7f35a4bb89","observation_id":"ca779509-a425-44b4-9fa3-f4ef2c4c499d","resolution":{"observed_at":"2026-08-07T14:13:43.286394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:43.332298Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:43.332298Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:10c8a8eaf145bebd88eb1b2399fc755190e94b33c214d6a429218f6de78b21f1","observation_id":"cb005e0f-90ed-4f99-afd6-8167ec8e821e","resolution":{"observed_at":"2026-08-07T14:13:43.332298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:43.401630Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:43.401630Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:85274e3a46a6203c84cf7ee20980c02cd2c27cfeac538044bb65fb8dcfa07cc6","observation_id":"f38b1d5c-48af-4d74-89f6-b42bfb1c031f","resolution":{"observed_at":"2026-08-07T14:13:43.401630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:43.447722Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:43.447722Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:f60fd610afa0d07dacc6699769bfc6c815eb18e5170f0dca59bfa0ec188b9d83","observation_id":"1bc9f33c-a524-4b3f-a735-159590340752","resolution":{"observed_at":"2026-08-07T14:13:43.447722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.349","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:46.961970Z","title":null,"venue":null,"work_id":"b3a9d0f2-a43b-4fbc-ba9e-263956c14cd0","year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:43.518635Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:4bb92967bb097dbea23df8c6228efa1a1d757aadf35b4d0257f41f8798c64404","observation_id":"ffdc149e-af48-4b85-845e-2283c2222422","resolution":{"observed_at":"2026-08-07T14:13:47.038230Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:43.596796Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:43.596796Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:42cfa06de44abfc9413029426a7720e6733cc9ea530fbc5d788ed79bd5da44d5","observation_id":"e24cc3aa-82ed-49a7-85cc-add338d9f79f","resolution":{"observed_at":"2026-08-07T14:13:43.596796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01238","last_updated":"2025-03-20T20:43:37Z","snapshot_observed_at":"2026-07-06T18:39:33.461088Z","submitted_at":"2024-07-01T12:32:38Z","title":"Large Language Models are Zero-Shot Recognizers for Activities of Daily Living","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01238","snapshot_observed_at":"2026-08-07T14:13:43.689317Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:43.689317Z"},"links":{"cited_paper":"/paper/2407.01238","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:d7f90eb2683b005bff2eead0b5d6f598916dd1a5ec3663a6438775b6bbd50ff0","observation_id":"e0ab7e4e-ab18-43e9-917e-aac7f15078b0","resolution":{"observed_at":"2026-08-07T14:13:43.689317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:13:43.827804Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:43.827804Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:4e620c3e37e05e7498e327eea00a2c007d944c49483f6d064a7868b34083398d","observation_id":"d5983e5f-bc04-459b-ad06-7655a5931430","resolution":{"observed_at":"2026-08-07T14:13:43.827804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T14:13:43.943987Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, , and et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:43.943987Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:ae0dabacb828e8cf7b09d0787bea55f688abd9118f997ec8a01f6e04eeaba353","observation_id":"8d08fffd-95fd-4b38-9247-f9eb368a9c73","resolution":{"observed_at":"2026-08-07T14:13:43.943987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:44.021942Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.021942Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:6a3f798e0b668965e1c89d6e08b8dee5791693782d6a9d31f354f2c8b09546e1","observation_id":"982d5f22-036a-4502-904c-699d83bda242","resolution":{"observed_at":"2026-08-07T14:13:44.021942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:13:44.078034Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.078034Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:50ffe7364483b8283e95bce6af86ab8c197cc9db856842235794c5f54478cd18","observation_id":"8eaf745e-3a1c-442d-bfcc-08fc2a7afbef","resolution":{"observed_at":"2026-08-07T14:13:44.078034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:44.123347Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.123347Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:2e36d57d65037465c6bfc68054657d5f72fb9fc538b42f7b4c6f81e780df8413","observation_id":"ca693e1d-bc1f-4e52-896e-3e0424899991","resolution":{"observed_at":"2026-08-07T14:13:44.123347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:44.188978Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.188978Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:b8556c8d0b06240599aabd194e9cd02a1187d6b94140c8142bcdd040dbe3da13","observation_id":"c42b9d1a-6942-44fc-bf21-2974ec21e6b4","resolution":{"observed_at":"2026-08-07T14:13:44.188978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:44.249236Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.249236Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:2f589d88b799eaff61b8a5b2a85e64a21d77890437b8103a5195ba41dc1cd1ba","observation_id":"fd8da448-0293-4630-acc9-fa3f5e5a9085","resolution":{"observed_at":"2026-08-07T14:13:44.249236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T14:13:44.301981Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.301981Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:7db586245dedec9f7caa9d24f9ee4e15c022a498b532fa54150f01c99e484cf8","observation_id":"6e7c4829-9483-439d-856f-24481277b628","resolution":{"observed_at":"2026-08-07T14:13:44.301981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:48.121777Z","title":null,"venue":null,"work_id":"46a48333-c32b-4f24-b4cf-ebf5d2f32a2a","year":2020},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.360111Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:94c6be0d954a828c1bb10a4021a9f8a76ab3c8596e81e709233968a54659ea5f","observation_id":"d8600576-ea32-438d-8979-7924446d81fa","resolution":{"observed_at":"2026-08-07T14:13:48.152087Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:44.432119Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.432119Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:393a585bb23e23ed19c398537653ee5c2327e54cbd93a01cbcef5fce4ff154dc","observation_id":"96a779d5-3ddc-4015-a79f-ce5ddfe19c45","resolution":{"observed_at":"2026-08-07T14:13:44.432119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:44.488889Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.488889Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:60c0856805cb164f531010ba34b9dca6a82377e4cbb87c98711b46b6304ea573","observation_id":"2c760aaa-4be0-40a2-b93b-de322bf81128","resolution":{"observed_at":"2026-08-07T14:13:44.488889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:44.566701Z","title":"u ttler, Mike Lewis, Wen-tau Yih, Tim Rockt\\","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.566701Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:9c00c3c159931e5c7d8588a60cdb09b5bafe6e26a5a633f544cedfff5916610a","observation_id":"dd151f6a-6fed-468b-b982-f13c2fee6987","resolution":{"observed_at":"2026-08-07T14:13:44.566701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.162","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:46.809554Z","title":null,"venue":null,"work_id":"7dc0c970-5668-4567-86fe-b81600f755ac","year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.625657Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:bbdd78303066cbd56b7755a048ecca122c874fff43fa9735cdd2eab98c767fca","observation_id":"1b39ce1c-0e88-4199-91e8-edb78905e3b7","resolution":{"observed_at":"2026-08-07T14:13:46.865885Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:44.668875Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.668875Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:0d6a02c28b8e289f165975266c0d598ee7fa6d4e70a6eb2627a3bc308813de3a","observation_id":"f3156878-3b6e-4ab3-a2f1-53f3ad017a88","resolution":{"observed_at":"2026-08-07T14:13:44.668875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:44.726154Z","title":"like having a really bad pa","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.726154Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:03751a9e37da704ba5067091a37e23108140f22ef5b4a40b01ba813f5301ba27","observation_id":"3b457e4d-8d6c-4b18-8eed-acca80c3ce9b","resolution":{"observed_at":"2026-08-07T14:13:44.726154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06807","last_updated":"2025-02-18T22:21:40Z","snapshot_observed_at":"2026-08-09T14:06:29.234036Z","submitted_at":"2025-02-03T23:00:15Z","title":"Competitive Programming with Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06807","snapshot_observed_at":"2026-08-07T14:13:44.797973Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.797973Z"},"links":{"cited_paper":"/paper/2502.06807","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:df4b360ad1c9f5567c6f5957344563102cf90d0dd54cf3a5dc24865e51dc5048","observation_id":"4812c028-8191-471b-8303-c72322123e79","resolution":{"observed_at":"2026-08-07T14:13:44.797973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2017.82613","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:47.631806Z","title":"Praveen Kumaar, U","venue":null,"work_id":"ce563788-bdd2-4187-a176-232479241ec9","year":2017},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.868342Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:f69f80c3f20d7bd75b7584f48cf6c1312ed2055ba21efe692734410d62f97ff6","observation_id":"020fa3ac-ea1b-4458-8cf9-3fdc45eb4b16","resolution":{"observed_at":"2026-08-07T14:13:47.681768Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.34719","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:47.463487Z","title":null,"venue":null,"work_id":"c6999279-dc86-42a2-974d-f386e4f9e3e9","year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.922876Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:88bf718c641056886b260397b2eca7ffb526b23b8aa3966f0afd539c5b6135ba","observation_id":"bb102c00-d36d-448e-97b6-969123654b5b","resolution":{"observed_at":"2026-08-07T14:13:47.506614Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12687","last_updated":"2024-08-22T19:00:50Z","snapshot_observed_at":"2026-07-06T19:04:47.884694Z","submitted_at":"2024-08-22T19:00:50Z","title":"Bridging the gap between natural user expression with complex automation programming in smart homes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12687","snapshot_observed_at":"2026-08-07T14:13:44.981357Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.981357Z"},"links":{"cited_paper":"/paper/2408.12687","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:82da915e130f8339847f1b802936904b32476beba68c8f106ffb9c6832a215ce","observation_id":"10d20b22-55eb-4ffe-a916-b8de84db9a19","resolution":{"observed_at":"2026-08-07T14:13:44.981357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:45.077406Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:45.077406Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:cd382f8d7ca4d4fb0b75da1fe1eb9eebb5f744bc0aace489ac4942771d48ce69","observation_id":"022d383b-d040-4c3d-817c-0ac2effee50d","resolution":{"observed_at":"2026-08-07T14:13:45.077406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:45.123799Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:45.123799Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:13e6f801e1ba991e64ec9bf4dbd3ecb2c8cc9ee7ee0edf7dc39fe47fc6cdbe1b","observation_id":"4c7f68ac-9775-4b51-932e-0896e9f657e7","resolution":{"observed_at":"2026-08-07T14:13:45.123799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-07T14:13:45.175232Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:45.175232Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:dd30bdd4357890b11527cc301c9c120954108547b121520a25acbf0915ba6307","observation_id":"0d691a22-4fe4-429e-b811-560c424c361e","resolution":{"observed_at":"2026-08-07T14:13:45.175232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:45.226150Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:45.226150Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:6bf272c95ac80879d44d561b8e4d1282fbf3a6cdfcc81cf1bfc472d0a608b1e9","observation_id":"edbbc504-43f3-4f0a-9833-bccf119e22b4","resolution":{"observed_at":"2026-08-07T14:13:45.226150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11230","last_updated":"2025-02-11T02:17:24Z","snapshot_observed_at":"2026-08-06T02:18:35.725376Z","submitted_at":"2024-06-17T05:54:06Z","title":"Multimodal Needle in a Haystack: Benchmarking Long-Context Capability of Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11230","snapshot_observed_at":"2026-08-07T14:13:45.327655Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:45.327655Z"},"links":{"cited_paper":"/paper/2406.11230","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:d514543344450c62010083903dbde56ab7fd66a9ee24629b5b4e023a0c40c5ff","observation_id":"2fa3711e-49f6-4feb-9648-7f5c95afec56","resolution":{"observed_at":"2026-08-07T14:13:45.327655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:45.391587Z","title":"Pan, and Kam-Fai Wong","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:45.391587Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:d25fb88d8260c469f68b73fde0ece10109009c809741f13730188da570c3e544","observation_id":"5d38553f-317a-4060-863c-76aa7ef00005","resolution":{"observed_at":"2026-08-07T14:13:45.391587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:45.442931Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:45.442931Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:432a034c191790cffb6e690b63f9021a38f2bdcd3b42affed96c1c1cdf18599b","observation_id":"2781f30f-e5be-4091-91ba-81146de4b90c","resolution":{"observed_at":"2026-08-07T14:13:45.442931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12896","last_updated":"2024-10-16T16:12:39Z","snapshot_observed_at":"2026-07-06T19:34:51.296918Z","submitted_at":"2024-10-16T16:12:39Z","title":"A Survey on Data Synthesis and Augmentation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12896","snapshot_observed_at":"2026-08-07T14:13:45.557406Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:45.557406Z"},"links":{"cited_paper":"/paper/2410.12896","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:0694ba4a9931a20dcd3d1475e2e85b8a93dc0011464d48e7debead221c487b12","observation_id":"12a817a1-34b2-46a4-a609-761c5e7dcc88","resolution":{"observed_at":"2026-08-07T14:13:45.557406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:45.638122Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:45.638122Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:86cc0a22305d486f1d955c8ff6813def9c4015dbe298d0c9ad7b2b969df7e670","observation_id":"2ee4f3d0-7f11-4bdc-a415-12a24f8a0a64","resolution":{"observed_at":"2026-08-07T14:13:45.638122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:13:45.785723Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:45.785723Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:6e9a9ae7b1f524035a89b40720750940c786e602343a5455bd8cc876fadc8326","observation_id":"e718eefb-c8c9-4cf3-a15d-01ae47e3c267","resolution":{"observed_at":"2026-08-07T14:13:45.785723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14252","last_updated":"2025-08-11T08:16:03Z","snapshot_observed_at":"2026-08-04T07:53:35.122021Z","submitted_at":"2024-10-18T08:02:36Z","title":"Harmony: A Human-Aware, Responsive, Modular Assistant with a Locally Deployed Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14252","snapshot_observed_at":"2026-08-07T14:13:45.895559Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:45.895559Z"},"links":{"cited_paper":"/paper/2410.14252","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:0e8152d479d2223ccfe0099f4fafe4be71ab9b3eedc8bc0dc185ed25525817e4","observation_id":"40919995-ee9e-4db0-9295-cb9ef0b33866","resolution":{"observed_at":"2026-08-07T14:13:45.895559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5730.34941","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:47.217116Z","title":null,"venue":null,"work_id":"092c6950-3080-4440-a4fd-6e133d7a9793","year":2021},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:45.993617Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:f8bd2671338e26cfe2845413f7384125a3dd2ad059ebac7d3672e6b7f5994d51","observation_id":"3149cf74-4e69-4a1e-a3f2-abcf0dbb7063","resolution":{"observed_at":"2026-08-07T14:13:47.251718Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3698145","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:46.664607Z","title":null,"venue":null,"work_id":"e7e4ca1d-d936-4fd0-aff0-bde92e2e60d9","year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:46.073671Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:1b59ea9c168a51e480d61cb1d4d2ade4d4afee28650e8711a77a44b4e68b7ef7","observation_id":"40616f42-4bfc-44ed-a98d-525a23f31ef1","resolution":{"observed_at":"2026-08-07T14:13:46.704433Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:47.997286Z","title":null,"venue":null,"work_id":"9881ad7a-117e-4b68-bd27-c5f10fa4b3fb","year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:46.114763Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:8b32d794685bef86640900a915b884f11ed7e120377bcdebc7e76bcd4214fa2c","observation_id":"6dd3210c-fb31-493d-ba84-9c27ec37629e","resolution":{"observed_at":"2026-08-07T14:13:48.046690Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01630","last_updated":"2024-09-03T05:56:50Z","snapshot_observed_at":"2026-07-06T19:09:32.189008Z","submitted_at":"2024-09-03T05:56:50Z","title":"SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01630","snapshot_observed_at":"2026-08-07T14:13:46.175242Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:46.175242Z"},"links":{"cited_paper":"/paper/2409.01630","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:f7307ac6167d79fced5b639b7b454970f3d59a0701688f3527dcf4fd94339877","observation_id":"dffd87c4-d69a-420e-8ed5-2f396c91873f","resolution":{"observed_at":"2026-08-07T14:13:46.175242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:46.240725Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:46.240725Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:ccb8a948af64cc37416a3301275be032f3858887cb4b7e4490e4ddcaeb57446a","observation_id":"48aa503a-b397-4579-b8fd-138712327a65","resolution":{"observed_at":"2026-08-07T14:13:46.240725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:46.299358Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:46.299358Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:270b1abc8d6aba3f52a8de66bb3045307b395be02e8935f50dfb26cbfbb34740","observation_id":"2198b13f-03df-486c-a0f4-322e42bc8651","resolution":{"observed_at":"2026-08-07T14:13:46.299358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.155","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:46.510235Z","title":null,"venue":null,"work_id":"000729eb-82e6-49d2-8990-ea116bad0aa6","year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:46.357862Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:90c6e4cff418fb6182c12a3f7afa2b55defc44c32f6abe06900ade76cfdfcff2","observation_id":"0fd12fc8-5012-47ab-9751-8a7f72cb6add","resolution":{"observed_at":"2026-08-07T14:13:46.563819Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04449","last_updated":"2024-11-28T12:28:02Z","snapshot_observed_at":"2026-07-06T18:58:22.457329Z","submitted_at":"2024-08-08T13:19:37Z","title":"EARBench: Towards Evaluating Physical Risk Awareness for Task Planning of Foundation Model-based Embodied AI Agents","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04449","snapshot_observed_at":"2026-08-07T14:13:46.416331Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:46.416331Z"},"links":{"cited_paper":"/paper/2408.04449","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:8b4bc42ba5143f04707e38c93f6edadbd83d295f76d990e239c00ad0bcfb516c","observation_id":"e447815a-8dc2-4951-bb7f-5fb5c1d6b12a","resolution":{"observed_at":"2026-08-07T14:13:46.416331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T09:46:40.475247Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":38,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2505.19628."}