{"as_of":"2026-08-13T10:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5e24c6e62716c68b07db98d335f35edc16ddcafc0ad147ab6d7988ef38d457e6","coverage":[{"denominator":218,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:21:59.257857Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.10692/citation-record","integrity":"/paper/2608.10692/integrity","json":"/paper/2608.10692/citation-record.json","paper":"/paper/2608.10692"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.624053Z","title":"Langley , title =","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.624053Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:178797ec3e47131820609e12f7b77e08d5aae219ad37ba757842f92c38317690","observation_id":"0d3d2b53-cf36-4553-99ae-37d9bec5e39a","resolution":{"observed_at":"2026-08-12T19:21:58.624053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00820","last_updated":"2024-10-28T17:05:10Z","snapshot_observed_at":"2026-08-13T05:17:20.876741Z","submitted_at":"2024-10-28T17:05:10Z","title":"AutoGLM: Autonomous Foundation Agents for GUIs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00820","snapshot_observed_at":"2026-08-12T19:21:58.630665Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.630665Z"},"links":{"cited_paper":"/paper/2411.00820","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:97f8ab5d2753d45101a4373e5bb4ef9e7c42b51c64c7e890f7c90a21fc131d1a","observation_id":"2e475699-9ac0-4f50-ab64-29a8dff91f87","resolution":{"observed_at":"2026-08-12T19:21:58.630665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.acl-long.504","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:23:28.856754Z","title":"Exploring the Potential of LLMs as Personalized Assistants: Dataset, Evaluation, and Analysis , booktitle =","venue":null,"work_id":"a09d0ae7-6a19-42bc-b548-401426587a00","year":2025},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.637393Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:c4fed83b3e47891d64ea940f9eabe8488f1680aa4eb821db1a98c0714c7c6cb4","observation_id":"2cbf283e-58e2-4f43-a012-a5ff84ee17f4","resolution":{"observed_at":"2026-08-12T19:23:28.892140Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.644209Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.644209Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:630f9962f71f3614b348b1e622177b56a3e80a8da2f9d832ec7bfabf9ef3b957","observation_id":"262e6737-2251-4969-8689-dc1ad8c3da03","resolution":{"observed_at":"2026-08-12T19:21:58.644209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2602.11964","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:23:28.753001Z","title":"Gaia2: Benchmarking","venue":null,"work_id":"e47727a5-72ff-4aa0-943f-4b4291569408","year":2026},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.650845Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:4f477553a15ed9462200ac12255c7e575adf875132e88f66409e7bb4dea084af","observation_id":"e5bd2610-ebc0-4921-beae-035751c68f56","resolution":{"observed_at":"2026-08-12T19:23:28.824200Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.656643Z","title":"The Thirteenth International Conference on Learning Representations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.656643Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:593720cc2e7ac08ab5ef04dfc16fcff7ce7f4f019994d01d25da9eb26e4d609b","observation_id":"5f2f6079-8e0c-423e-9418-3d4d740cc9cf","resolution":{"observed_at":"2026-08-12T19:21:58.656643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.662759Z","title":"AndroidLab: Training and Systematic Benchmarking of Android Autonomous Agents , booktitle =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.662759Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:cc1c806768a73abef4b27be9cabe11ee8dd05df90e622d92312a75ad5abd18d7","observation_id":"2eed80e8-4fda-4798-b393-f5c232c1374f","resolution":{"observed_at":"2026-08-12T19:21:58.662759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.671216Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments , booktitle =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.671216Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:74e4fe9ef4cdcb9b03d60ce64afbfe44b9e484cbf53437477fe9a72635a553a2","observation_id":"aab3ff45-1e69-4b58-8a2b-06ba5ec7c50b","resolution":{"observed_at":"2026-08-12T19:21:58.671216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v40i42.40874","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:23:28.522206Z","title":"Mind the Third Eye! Benchmarking Privacy Awareness in MLLM-powered Smartphone Agents , booktitle =","venue":null,"work_id":"1b77cf07-7344-4768-be9c-2c5422cfea7c","year":2026},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.676550Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:1a6a05279ae0d8e94ee72bd1142dcb308b29a7915d8290975bdf7f115bdb7f9c","observation_id":"f6fa389a-5855-47e3-91a9-d72036d08e70","resolution":{"observed_at":"2026-08-12T19:23:28.642993Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.682339Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers),","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.682339Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:607566e249158c47024c62ebd9ea590334a0a6caa49bcd40d55a7e0338bf5c77","observation_id":"e2c12d1e-c277-49ae-9edd-0c9fd3d326f0","resolution":{"observed_at":"2026-08-12T19:21:58.682339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.687685Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.687685Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:bf6d949ebfac40b4c1ee9d8eee61f5a94551499a5096148543174c4cc7a7d96a","observation_id":"1690fc54-620e-43d7-8ebc-5973c210db23","resolution":{"observed_at":"2026-08-12T19:21:58.687685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.693441Z","title":"AppAgent: Multimodal Agents as Smartphone Users , booktitle =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.693441Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:532bbfc8a2e4b8b5aed881a01c2e415ab8d8d1c5cc371d6f245594fa1fc34602","observation_id":"e7fbe459-18b3-4e79-85f5-3ccb31a31ff5","resolution":{"observed_at":"2026-08-12T19:21:58.693441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-12T19:21:58.698799Z","title":"DeepSeek-V3 Technical Report , journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.698799Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:f53866cce25cea36f284c3f9f0288a102b1e37db53714c1b641ec68574c109ab","observation_id":"76666871-2092-490d-aa4e-e780c00513fe","resolution":{"observed_at":"2026-08-12T19:21:58.698799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.704359Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.704359Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:8a96eacdc1b143e5cb08682c10a436288483372e9ecbc68677050f4cf305a907","observation_id":"d908d904-43c2-43cd-8707-8af95370b703","resolution":{"observed_at":"2026-08-12T19:21:58.704359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16944","last_updated":"2025-05-22T17:31:10Z","snapshot_observed_at":"2026-08-07T20:49:20.049385Z","submitted_at":"2025-05-22T17:31:10Z","title":"AGENTIF: Benchmarking Instruction Following of Large Language Models in Agentic Scenarios","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16944","snapshot_observed_at":"2026-08-12T19:21:58.709584Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.709584Z"},"links":{"cited_paper":"/paper/2505.16944","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:2106a556b21cd09915e8385ebee1e9686e0c12ffb224efea65996c26dbd230d6","observation_id":"3a3361d7-5ae0-455f-9895-ca98c1e57cfa","resolution":{"observed_at":"2026-08-12T19:21:58.709584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.715967Z","title":"From Complex to Simple: Enhancing Multi-Constraint Complex Instruction Following Ability of Large Language Models , booktitle =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.715967Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:e0c359e5162bde49ea6db71cc17f4f07a3835484e10b3e4b0d95bbb52740ba45","observation_id":"3dda646a-c5d9-4723-85f3-7de59453ace0","resolution":{"observed_at":"2026-08-12T19:21:58.715967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.721936Z","title":"The Thirteenth International Conference on Learning Representations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.721936Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:3f20d03de66dd7b1dbe257d2cd4c85150696d66af714878c33314c431b7a42c5","observation_id":"a46d83d4-d7ba-4869-ae16-463c5eba8be4","resolution":{"observed_at":"2026-08-12T19:21:58.721936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.727753Z","title":"The Twelfth International Conference on Learning Representations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.727753Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:6d82e554c93a08c54612eb5bbdcd998deafa63100f0a9def677ff97d019c2153","observation_id":"8999ef49-cbed-404e-9226-2314b38e0b14","resolution":{"observed_at":"2026-08-12T19:21:58.727753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.733603Z","title":"The Thirteenth International Conference on Learning Representations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.733603Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:8829694532ad646360b780e9db99ccfcec60b0477eae58729b6186ca36d2fad1","observation_id":"376c67ef-44bd-4260-9b91-fcdda83d8c95","resolution":{"observed_at":"2026-08-12T19:21:58.733603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.739412Z","title":"FanOutQA:","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.739412Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:0c3c06712ce68d8a92d1c895bd22287f93676cfb88280741f0f1abae19c136e6","observation_id":"ab0b0730-1558-44c2-9e1e-c3ae8030677a","resolution":{"observed_at":"2026-08-12T19:21:58.739412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.746854Z","title":"Evaluating Design Decisions for Dual Encoder-based Entity Disambiguation , booktitle =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.746854Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:798cc14215b359204023316508c0f365b8fd3e750622e316906524d7e6407d51","observation_id":"98778e32-1a63-4115-b78c-204c22101d1d","resolution":{"observed_at":"2026-08-12T19:21:58.746854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.753970Z","title":"Cohen and Ruslan Salakhutdinov and Christopher D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.753970Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:8669243f66e9ab0db031d555bf7e38442b850059ad1ee780e0bccfdc1c419b31","observation_id":"ef4c0d86-c4b4-4050-bc2c-3b701dc087d9","resolution":{"observed_at":"2026-08-12T19:21:58.753970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02833","last_updated":"2025-11-11T09:40:12Z","snapshot_observed_at":"2026-08-11T23:30:41.054794Z","submitted_at":"2025-07-03T17:44:33Z","title":"Generalizing Verifiable Instruction Following","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02833","snapshot_observed_at":"2026-08-12T19:21:58.763030Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.763030Z"},"links":{"cited_paper":"/paper/2507.02833","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:6a6e1f66ead4a416f6b3258ab6160df7bca076bf1ebe356d2d5547d741798cc8","observation_id":"713569f4-462e-41df-8ac5-7ab811aef820","resolution":{"observed_at":"2026-08-12T19:21:58.763030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.770692Z","title":"On the Multi-turn Instruction Following for Conversational Web Agents , booktitle =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.770692Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:cea54a40c65a7f307041082237a02cc24245e9c7404557664d1ed9af26f0ab95","observation_id":"f677e6b5-217f-4c6d-aa0a-463420e36a22","resolution":{"observed_at":"2026-08-12T19:21:58.770692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v39i22.34551","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:23:28.421624Z","title":"Toward Verifiable Instruction-Following Alignment for Retrieval Augmented Generation , booktitle =","venue":null,"work_id":"d545d076-79c2-422a-8d23-3ab43ef34820","year":2025},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.778032Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:47c48492b19218c5148a2804f9c4df68788ce74c09852e8c12700e847a494c41","observation_id":"17883964-782b-490b-a663-6947cb8de8d1","resolution":{"observed_at":"2026-08-12T19:23:28.426948Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.783860Z","title":"TL-Training:","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.783860Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:3d88b897813ffa72eacf703c84f296bd26ad39be020559a15216a49bbdbbbe82","observation_id":"9b496bff-8d9a-478d-8414-54874be83004","resolution":{"observed_at":"2026-08-12T19:21:58.783860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-12T19:21:58.790762Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.790762Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:ef5d118f02244b54a5c4d7d5b8fe592856f63f915f8206795fb9c21b74cca51d","observation_id":"a707554c-dccf-4d71-8ff1-4964b98cfabc","resolution":{"observed_at":"2026-08-12T19:21:58.790762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19803","last_updated":"2025-03-03T15:13:10Z","snapshot_observed_at":"2026-08-12T22:21:37.955255Z","submitted_at":"2024-10-16T17:59:47Z","title":"First-Person Fairness in Chatbots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19803","snapshot_observed_at":"2026-08-12T19:21:58.796199Z","title":"Robinson and Keren Gu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.796199Z"},"links":{"cited_paper":"/paper/2410.19803","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:924f2e1e79bb5c73da29f84452094f657d64ca672cdc1ba94debf8f94c50817a","observation_id":"aacb158e-0f82-445c-a4aa-d300ef1634b9","resolution":{"observed_at":"2026-08-12T19:21:58.796199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.802775Z","title":"Tool learning with large language models: a survey , journal =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.802775Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:2882bb6b2f31c37555f984adab0348d196ea97502d49a1644f0ad4ad295b4a12","observation_id":"504da331-f6d2-4bc9-8721-fc5ce57263aa","resolution":{"observed_at":"2026-08-12T19:21:58.802775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.808303Z","title":null,"venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.808303Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:85e390047ff82993ab179b6f2668eae02615d14ad7d129718922cb485a3bc780","observation_id":"e8a15dec-dc31-4a63-9077-949d426406d9","resolution":{"observed_at":"2026-08-12T19:21:58.808303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.814046Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.814046Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:ca6762561fa747ed542bfe36c577f2cc2829f38219ab8506b13ac38047fb8338","observation_id":"60fe019a-b7e9-434c-9d3c-66d7cf60f3aa","resolution":{"observed_at":"2026-08-12T19:21:58.814046Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.819426Z","title":null,"venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.819426Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:e10f27905c4d04d7c0dc8cdfe23916707fe48e2497e94ba936dac26dbabe0019","observation_id":"870b9e98-03eb-4190-9e6f-4636f8289b2e","resolution":{"observed_at":"2026-08-12T19:21:58.819426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.825117Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.825117Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:8be450b37e1aefe8c17082ed7217a47ce0f7e2410ed3c70fa6ba282a242ecedd","observation_id":"0f664a46-f911-4e3c-8dec-6054188e3f03","resolution":{"observed_at":"2026-08-12T19:21:58.825117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.830362Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.830362Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:c52cf5ba62e9b20d6cc2b6a4814d9af397c5768734377004835e0e8109c1c8a9","observation_id":"28bd6c66-ec43-40bb-a772-66eaeebf9336","resolution":{"observed_at":"2026-08-12T19:21:58.830362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.836583Z","title":"Newell and P","venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.836583Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:af660ec2550d96928906ebaf9e4b1b42d776ed735a9d7a59a02d8d960ac9dedb","observation_id":"84bf6d1d-6af2-4e55-bd46-320b798ddfd3","resolution":{"observed_at":"2026-08-12T19:21:58.836583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.842032Z","title":null,"venue":null,"work_id":null,"year":1959},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.842032Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:67aa2f5d177fae8ca96ccfb5b574e4a49070d80ebdca1b71305ead403eec3c8a","observation_id":"cc89091e-2067-42c9-906d-0a82fbe3de2c","resolution":{"observed_at":"2026-08-12T19:21:58.842032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.850170Z","title":"Toolformer: Language Models Can Teach Themselves to Use Tools , booktitle =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.850170Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:85c9aabd18c8c9727638934588b9ef32d48539ffb43b2db0bd94742a28279a8d","observation_id":"a5ecb3c6-38d4-400a-9903-416c564c4d3a","resolution":{"observed_at":"2026-08-12T19:21:58.850170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.855533Z","title":"and Stoica, Ion and Xing, Eric P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.855533Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:19c732e8b0a8a3de6a368f4f09c3de48f948996948a44e647f87e6ab92699361","observation_id":"6e94bcfa-ef29-4123-8fa6-6c6146d3122b","resolution":{"observed_at":"2026-08-12T19:21:58.855533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-12T19:21:58.862026Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback , journal =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.862026Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:6cb28f08dc9fb0bdbeb64da1d016a3427d064c9eab9e75dbf92ac88cf99809a1","observation_id":"eead0c0a-dcdf-469c-a06c-a3382e82d138","resolution":{"observed_at":"2026-08-12T19:21:58.862026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-12T19:21:58.868620Z","title":"Brown and Benjamin Chess and Rewon Child and Scott Gray and Alec Radford and Jeffrey Wu and Dario Amodei , title =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.868620Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:c330e8868ded01f4dd2523eeff29b30ca4c533b4b99c90011c1cf7de6d80af5a","observation_id":"f503f6ea-2063-4c3e-bdf7-4b9d802ef501","resolution":{"observed_at":"2026-08-12T19:21:58.868620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.875174Z","title":"2011 , publisher=","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.875174Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:7a44ad5576b4676a498cd98c04d339a5d7a534a3f13a3c335d39e8ddb2a6b930","observation_id":"409a4d5f-eb31-4393-b95c-0ab7fa7dbbe1","resolution":{"observed_at":"2026-08-12T19:21:58.875174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06624","last_updated":"2023-08-27T02:55:36Z","snapshot_observed_at":"2026-08-08T23:18:33.099540Z","submitted_at":"2023-06-11T08:53:12Z","title":"RestGPT: Connecting Large Language Models with Real-World RESTful APIs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06624","snapshot_observed_at":"2026-08-12T19:21:58.880808Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.880808Z"},"links":{"cited_paper":"/paper/2306.06624","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:670182142d4272ee58102db705f3211575a3ed6f0e7b5064c31351d4ff9e6be2","observation_id":"d1bf6ce0-cf16-42e1-801e-9a1d8e4da587","resolution":{"observed_at":"2026-08-12T19:21:58.880808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.886530Z","title":"Improving Language Models by Retrieving from Trillions of Tokens , booktitle =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.886530Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:634ea77693148a4142483100859a4b48b26c3d037e06bdbe0b362a03d504f2b0","observation_id":"677d6db5-626c-49a2-8c2c-1758ecae4f89","resolution":{"observed_at":"2026-08-12T19:21:58.886530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09842","last_updated":"2023-10-31T17:43:39Z","snapshot_observed_at":"2026-07-06T15:17:37.705662Z","submitted_at":"2023-04-19T17:47:47Z","title":"Chameleon: Plug-and-Play Compositional Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09842","snapshot_observed_at":"2026-08-12T19:21:58.891620Z","title":"Chameleon: Plug-and-Play Compositional Reasoning with Large Language Models , journal =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.891620Z"},"links":{"cited_paper":"/paper/2304.09842","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:5409901f7b1dd7a8b5ae9cb99cbb829c084b30fe02e44c62bcbbc53b0714722d","observation_id":"22ec1c83-0ad8-411f-8276-1f1df8abbe85","resolution":{"observed_at":"2026-08-12T19:21:58.891620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-12T19:21:58.897223Z","title":"LaMDA: Language Models for Dialog Applications , journal =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.897223Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:6480ff042153c5c93d89880776a8af7f15f97d602e91bf777d7c08f63a24c206","observation_id":"559368ef-7b8c-4ab8-a315-6d5ec915e2f3","resolution":{"observed_at":"2026-08-12T19:21:58.897223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12255","last_updated":"2022-05-24T17:58:13Z","snapshot_observed_at":"2026-08-07T07:09:50.694532Z","submitted_at":"2022-05-24T17:58:13Z","title":"TALM: Tool Augmented Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12255","snapshot_observed_at":"2026-08-12T19:21:58.903319Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.903319Z"},"links":{"cited_paper":"/paper/2205.12255","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:2b2630c3be5883defac5443d9039b36c959f9284f631daa405bb6e84c334ebb6","observation_id":"76062a80-5d32-46be-b837-e9e9ab1b69fa","resolution":{"observed_at":"2026-08-12T19:21:58.903319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17580","last_updated":"2023-12-03T18:17:21Z","snapshot_observed_at":"2026-08-12T12:50:51.005571Z","submitted_at":"2023-03-30T17:48:28Z","title":"HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17580","snapshot_observed_at":"2026-08-12T19:21:58.908726Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.908726Z"},"links":{"cited_paper":"/paper/2303.17580","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:9842351ec5410267a0a1f01eff8838a48c701cc437b42f95c05085322ff81317","observation_id":"16d20607-24fc-42bd-beca-d3ee04d9c111","resolution":{"observed_at":"2026-08-12T19:21:58.908726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11554","last_updated":"2024-01-15T23:52:21Z","snapshot_observed_at":"2026-08-10T00:28:37.615484Z","submitted_at":"2023-05-19T09:54:21Z","title":"ToolkenGPT: Augmenting Frozen Language Models with Massive Tools via Tool Embeddings","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11554","snapshot_observed_at":"2026-08-12T19:21:58.914291Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.914291Z"},"links":{"cited_paper":"/paper/2305.11554","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:159d46e7ae5bbd34423a451b22093f4c75c8bf1c8d861b68c0e805dc780a013f","observation_id":"6416dcc2-8d0e-40de-be70-bd8c56b2e984","resolution":{"observed_at":"2026-08-12T19:21:58.914291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16504","last_updated":"2023-05-25T22:10:20Z","snapshot_observed_at":"2026-08-12T04:34:54.216201Z","submitted_at":"2023-05-25T22:10:20Z","title":"On the Tool Manipulation Capability of Open-source Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16504","snapshot_observed_at":"2026-08-12T19:21:58.919706Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.919706Z"},"links":{"cited_paper":"/paper/2305.16504","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:5d312d3b35799cb331e350d4e0aeb08eb653dc0a4d4a0bfd5d348eff9ff8c1bd","observation_id":"0d8f8a41-0d7f-467f-9700-deacd409d182","resolution":{"observed_at":"2026-08-12T19:21:58.919706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01560","last_updated":"2024-07-08T05:56:47Z","snapshot_observed_at":"2026-08-02T14:50:04.461434Z","submitted_at":"2023-02-03T06:06:27Z","title":"Describe, Explain, Plan and Select: Interactive Planning with Large Language Models Enables Open-World Multi-Task Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01560","snapshot_observed_at":"2026-08-12T19:21:58.925867Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.925867Z"},"links":{"cited_paper":"/paper/2302.01560","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:d612147871c1030cc23c2479957a39b833c8051d84ed50156635446b78f0c205","observation_id":"243aed30-d86c-4f25-98f4-3ca26e64c1db","resolution":{"observed_at":"2026-08-12T19:21:58.925867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.932398Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.932398Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:7c124911d39946fba2c2586faa446812264e849073a92bbfedda32cc7293a6ba","observation_id":"02c142c0-e3f2-4826-9212-702502787eff","resolution":{"observed_at":"2026-08-12T19:21:58.932398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-12T19:21:58.938065Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.938065Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:4c6334c17e6fff2fcc9581e075ecd5393e49757c4e0d67f7fccfaf11032b073d","observation_id":"6a088319-384f-4d81-8edc-c2a88aa94bc5","resolution":{"observed_at":"2026-08-12T19:21:58.938065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-12T19:21:58.944883Z","title":"Zhao and Yanping Huang and Andrew M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.944883Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:fe122649d44a9e9138f17afb4fb901d783554b6976cd0064502da4c9a482d5ce","observation_id":"92a932cd-81a9-49f3-abcb-5181cffe8eaf","resolution":{"observed_at":"2026-08-12T19:21:58.944883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.950479Z","title":"Chi and Tatsunori Hashimoto and Oriol Vinyals and Percy Liang and Jeff Dean and William Fedus , title =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.950479Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:53c7d1514b508a19b1782b4ee20c625bf00e0a9d9d47c4e4f21c614b8e6693c4","observation_id":"d0e7730e-4561-43e5-b1b9-12d4d2d64d5c","resolution":{"observed_at":"2026-08-12T19:21:58.950479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.956016Z","title":"Narasimhan and Yuan Cao , title =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.956016Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:388f61d00917a3e9c2372722fb944ba3ee5dd8c6ea1c510220e83eb560aa8edb","observation_id":"ffc3ef02-0713-4f13-9505-a6ef09f776e8","resolution":{"observed_at":"2026-08-12T19:21:58.956016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.961736Z","title":"Chi and Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.961736Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:56c11a1ad09d7ccdfa326877eaaec7fa9a3e70de2b8d886c90e80bf7a0e8b008","observation_id":"b290845d-1959-4e9d-aee2-e1cef7ef86fd","resolution":{"observed_at":"2026-08-12T19:21:58.961736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-08-12T04:55:58.532015Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-12T19:21:58.967514Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.967514Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:278cf745a13e395b58958790692933e0f7100091766a77d0517cf5b42cb47a0e","observation_id":"501493c6-4cda-46d7-af8f-2689efd2876d","resolution":{"observed_at":"2026-08-12T19:21:58.967514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08775","last_updated":"2024-01-31T04:11:42Z","snapshot_observed_at":"2026-08-12T03:37:34.681674Z","submitted_at":"2023-07-17T18:42:05Z","title":"GEAR: Augmenting Language Models with Generalizable and Efficient Tool Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08775","snapshot_observed_at":"2026-08-12T19:21:58.973424Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.973424Z"},"links":{"cited_paper":"/paper/2307.08775","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:f8c7db00850745f1e35bbae36351c78e9f2c498d4752842bf91cb42a0f34666e","observation_id":"18b28abb-e018-486c-b4ec-84c4705b8b48","resolution":{"observed_at":"2026-08-12T19:21:58.973424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-12T19:21:58.978942Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.978942Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:a54fb0ae5e6f4e71f6389c99a1c008e3b5d5f76eb3b466e926fab61f77731d93","observation_id":"43770c68-76d8-4d26-97d8-0aa098cde640","resolution":{"observed_at":"2026-08-12T19:21:58.978942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.984416Z","title":"GPT4Tools: Teaching Large Language Model to Use Tools via Self-instruction , booktitle =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.984416Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:da75357b51d92ad7ea8e02c909aa6441244fe8b67b0dec2d74592619d5a6185a","observation_id":"67a41b55-0915-4817-b76f-f48acc6c4949","resolution":{"observed_at":"2026-08-12T19:21:58.984416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.990406Z","title":", author=","venue":null,"work_id":null,"year":1947},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.990406Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:a613cf9c5eed36a8a87e2923654b031754c9678e22a66195b3d996d68402c4fb","observation_id":"aca258d9-31f2-48d8-8c41-62638fd2de37","resolution":{"observed_at":"2026-08-12T19:21:58.990406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:58.996026Z","title":"Patil and Tianjun Zhang and Xin Wang and Joseph E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:58.996026Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:9a4b1af41f491c02a5f215e893723425c35c485719d4af19c743f4e75a2e0040","observation_id":"cd50d75b-b662-4e67-a8d2-d9eb00453e05","resolution":{"observed_at":"2026-08-12T19:21:58.996026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:59.001037Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.001037Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:3f1871ae0119b20a8d40ab8412e0ff1d84368cd58d1176bead6eaf22e1192fd3","observation_id":"444ba3f7-2efe-410e-9ed9-ad98eb8d3466","resolution":{"observed_at":"2026-08-12T19:21:59.001037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:59.008901Z","title":"Label Words are Anchors: An Information Flow Perspective for Understanding In-Context Learning , booktitle =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.008901Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:d726460fda5cd3e279e6b46c6a28d8ae49b21c1aeae96c65d83db529ee25f1ab","observation_id":"d61a495b-167e-4bd3-9e9c-9f728b833094","resolution":{"observed_at":"2026-08-12T19:21:59.008901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:59.014624Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.014624Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:69f8214c1542ff8f43a188b2af8cfa4ed6a1ade427201107560d22701947c600","observation_id":"06fcce3a-1348-4f1a-8bbc-40eb06386d6c","resolution":{"observed_at":"2026-08-12T19:21:59.014624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:59.019788Z","title":"Rethinking the Role of Demonstrations: What Makes In-Context Learning Work? , booktitle =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.019788Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:1f17be5dfec17032d2ceffeec550ffd263df011b79e7a5108df7c7abb4ba31ce","observation_id":"7d6ee9cc-40a1-4fe8-ba2c-7d3bfa9bf6e4","resolution":{"observed_at":"2026-08-12T19:21:59.019788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-12T19:21:59.028908Z","title":"Nye and Maarten Bosma and Henryk Michalewski and David Dohan and Ellen Jiang and Carrie J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.028908Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:b8f4c7b1278ddcaaf0024b97f4b4024fa27baf39a95d12280d2495bf980a23c0","observation_id":"7a84ff0a-1049-410a-ade2-7db6586bc985","resolution":{"observed_at":"2026-08-12T19:21:59.028908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:59.034957Z","title":"Measuring Mathematical Problem Solving With the","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.034957Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:6c2b7fd01274702cef75aec1fb38ef162b849b90042e866a126c5bec25fb259a","observation_id":"5e6bd6cc-eee7-45d3-8a77-6595fb417be9","resolution":{"observed_at":"2026-08-12T19:21:59.034957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:59.043085Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.043085Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:a5487e15e49819965652c82c0e967977b80a67b987f68fca5c9852dbc523d394","observation_id":"c5f4779d-be23-4e95-a7ed-c12dbb3cf7a2","resolution":{"observed_at":"2026-08-12T19:21:59.043085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-12T19:21:59.049354Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.049354Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:a5a670a8c950a2f437e1eb521058d7390be934bc58d8eb6442b3112fdb1fd872","observation_id":"64e51fcf-4af9-40e3-abb9-65f4ea18934e","resolution":{"observed_at":"2026-08-12T19:21:59.049354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:59.055383Z","title":"InFoBench: Evaluating Instruction Following Ability in Large Language Models , booktitle =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.055383Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:e04bed81c7cb4a93d401092fb24c46eb92ba68bdc2ea877229047fa4f0ebe78d","observation_id":"3fec37c2-3645-4121-acad-f36ed77b903b","resolution":{"observed_at":"2026-08-12T19:21:59.055383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06208","last_updated":"2025-07-17T08:39:11Z","snapshot_observed_at":"2026-08-12T22:04:14.905992Z","submitted_at":"2024-11-09T15:12:43Z","title":"IOPO: Empowering LLMs with Complex Instruction Following via Input-Output Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06208","snapshot_observed_at":"2026-08-12T19:21:59.062541Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.062541Z"},"links":{"cited_paper":"/paper/2411.06208","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:7767430f1da63c2931aa8508a083de2de7c437585e6c6980453009daa2bcaa89","observation_id":"43eecf78-d042-48cf-93b1-2fc5599aec3b","resolution":{"observed_at":"2026-08-12T19:21:59.062541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-acl.739","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:22:01.702163Z","title":"CIF-Bench:","venue":null,"work_id":"471974dc-f723-4fc3-bba8-41f854417b2e","year":2024},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.069885Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:1feadfd05484e4269153839666f27d6f1869319c4061517ef6825bbabc10422b","observation_id":"c381b3c8-f251-46ff-8408-0aeceb4b2af3","resolution":{"observed_at":"2026-08-12T19:22:01.708390Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:59.077006Z","title":"Manning and Stefano Ermon and Chelsea Finn , editor =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.077006Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:3175cda64ad36b07abc3a3952e9634f0cd59a74b073817803928932833346da3","observation_id":"219506e4-e879-48af-b797-41ff5f411b71","resolution":{"observed_at":"2026-08-12T19:21:59.077006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09829","last_updated":"2023-11-16T11:53:31Z","snapshot_observed_at":"2026-08-13T05:23:55.241481Z","submitted_at":"2023-11-16T11:53:31Z","title":"FollowEval: A Multi-Dimensional Benchmark for Assessing the Instruction-Following Capability of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09829","snapshot_observed_at":"2026-08-12T19:21:59.082243Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.082243Z"},"links":{"cited_paper":"/paper/2311.09829","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:8ea18b24a87054e9d68c83414376b8c0277d47604350b43ed5012122639dec27","observation_id":"e1fda741-9ab2-465b-8824-813dcb2ae246","resolution":{"observed_at":"2026-08-12T19:21:59.082243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:59.087672Z","title":"From Complex to Simple: Enhancing Multi-Constraint Complex Instruction Following Ability of Large Language Models , booktitle =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.087672Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:3e6a7f85b7b743868a0c0564a8930720809ebfd303337f19c747452e4f58f860","observation_id":"d7131c1c-784a-45c8-924e-ac75120185b5","resolution":{"observed_at":"2026-08-12T19:21:59.087672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02823","last_updated":"2024-04-03T15:55:39Z","snapshot_observed_at":"2026-08-13T00:38:21.431127Z","submitted_at":"2024-04-03T15:55:39Z","title":"Conifer: Improving Complex Constrained Instruction-Following Ability of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02823","snapshot_observed_at":"2026-08-12T19:21:59.093215Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.093215Z"},"links":{"cited_paper":"/paper/2404.02823","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:91530980210b9e2682601a3d218858e155da2cff81f28013d15e3ed1ac7dd453","observation_id":"37c7d433-dc3e-4ac7-a205-acaa6e91b16b","resolution":{"observed_at":"2026-08-12T19:21:59.093215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13542","last_updated":"2024-07-18T09:00:23Z","snapshot_observed_at":"2026-08-12T23:39:12.754778Z","submitted_at":"2024-06-19T13:29:53Z","title":"Self-play with Execution Feedback: Improving Instruction-following Capabilities of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13542","snapshot_observed_at":"2026-08-12T19:21:59.098498Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.098498Z"},"links":{"cited_paper":"/paper/2406.13542","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:8f0ac6051124936f2c09c71695141aee947f0f8ad96cd427bb8ef338a1ae6b48","observation_id":"89c0deb6-04e4-46e9-a823-fd598e39e6a4","resolution":{"observed_at":"2026-08-12T19:21:59.098498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11605","last_updated":"2025-03-16T09:43:15Z","snapshot_observed_at":"2026-08-12T07:38:02.124252Z","submitted_at":"2024-12-16T09:47:43Z","title":"SPaR: Self-Play with Tree-Search Refinement to Improve Instruction-Following in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11605","snapshot_observed_at":"2026-08-12T19:21:59.104812Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.104812Z"},"links":{"cited_paper":"/paper/2412.11605","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:f62c5db22971bc67832c5faf511abbe55ebd9e5a71abbd3d6760df2202ec1d2c","observation_id":"bb77a871-757a-4ad2-842f-b800da01771a","resolution":{"observed_at":"2026-08-12T19:21:59.104812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15553","last_updated":"2024-11-13T04:26:13Z","snapshot_observed_at":"2026-08-12T22:19:04.052792Z","submitted_at":"2024-10-21T00:59:47Z","title":"Multi-IF: Benchmarking LLMs on Multi-Turn and Multilingual Instructions Following","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15553","snapshot_observed_at":"2026-08-12T19:21:59.112477Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.112477Z"},"links":{"cited_paper":"/paper/2410.15553","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:c290af11538eb8d3317017e6bc2643cc775400320ca0d42971ffcccc63f4e13e","observation_id":"7cb0ccac-6e5e-4765-8b12-d6536c089f2e","resolution":{"observed_at":"2026-08-12T19:21:59.112477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:59.118087Z","title":"FollowBench:","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.118087Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:72522a8db65c40e7faa88385a6e9b651d9aff0add6181c0d7aa04ae98fb94d8f","observation_id":"b21da20d-4005-4b86-bb06-3eee258a38e9","resolution":{"observed_at":"2026-08-12T19:21:59.118087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01437","last_updated":"2024-07-12T17:20:34Z","snapshot_observed_at":"2026-08-12T23:31:07.491213Z","submitted_at":"2024-07-01T16:32:16Z","title":"Needle in the Haystack for Memory Based Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01437","snapshot_observed_at":"2026-08-12T19:21:59.129521Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.129521Z"},"links":{"cited_paper":"/paper/2407.01437","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:fac3cc6f0684697a3919fb2577bd8a161c3b6c11f965101a9ba1988b0abff607","observation_id":"8dea1378-933a-4d8f-856b-792e97303e34","resolution":{"observed_at":"2026-08-12T19:21:59.129521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-12T19:21:59.135717Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.135717Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:a11c4ab3df54112ccf6469f5e3486d2da3e61b01bf3a49fbd1148451da0a62e3","observation_id":"f76cd0a4-0968-40aa-a153-c79214cd5fc1","resolution":{"observed_at":"2026-08-12T19:21:59.135717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:59.143832Z","title":"Findings of the Association for Computational Linguistics,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.143832Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:13df6d5187a47161501d4e2ccfce1d0af4e2481630d7b7019eb55b00d668f607","observation_id":"259dd41d-7df7-40b7-9726-859a10de69a5","resolution":{"observed_at":"2026-08-12T19:21:59.143832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08085","last_updated":"2023-04-17T09:00:50Z","snapshot_observed_at":"2026-08-12T18:46:59.161352Z","submitted_at":"2023-04-17T09:00:50Z","title":"InstructUIE: Multi-task Instruction Tuning for Unified Information Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08085","snapshot_observed_at":"2026-08-12T19:21:59.152621Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.152621Z"},"links":{"cited_paper":"/paper/2304.08085","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:fa893271ba8b591488fc72a9315693bb11593934ee535ce0b4bed7aec6f3e9c5","observation_id":"dc5eecb0-ae1b-4ca8-b5ad-b73c7525b84c","resolution":{"observed_at":"2026-08-12T19:21:59.152621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:59.160015Z","title":"Long Context vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.160015Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:aa44834dbf34dcd89a76bbeddf7ba1e991308e01ba335cfde94916d9956cde2f","observation_id":"e6d96620-9d51-4b89-af16-2dd3598b649a","resolution":{"observed_at":"2026-08-12T19:21:59.160015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07591","last_updated":"2026-04-15T04:31:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T14:16:55Z","title":"MulDimIF: A Multi-Dimensional Constraint Framework for Evaluating and Improving Instruction Following in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07591","snapshot_observed_at":"2026-08-12T19:21:59.166468Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.166468Z"},"links":{"cited_paper":"/paper/2505.07591","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:3ede6ee8fbe3ad4a4995a1371f6a2c7ce6c7d9e449425f0a5489af6af35a954e","observation_id":"c183f780-9786-431c-b428-3cd84bbbf6d9","resolution":{"observed_at":"2026-08-12T19:21:59.166468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:59.172188Z","title":"The Thirteenth International Conference on Learning Representations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.172188Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:3d43c0ccfdfaacbb921fb3e375025cf7aa8702b3af244343b8c18a42532f94e2","observation_id":"f43e3356-ddf2-45e9-889f-ebe1c070661a","resolution":{"observed_at":"2026-08-12T19:21:59.172188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:59.179579Z","title":"Hanjie and Runzhe Yang and Karthik R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.179579Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:242cd61f765d81a97c71fc0302e3ff9ca9b89ef6e4df3dbf11993661cd499bab","observation_id":"6edc0562-3a95-46b9-8612-4b61d88ba15b","resolution":{"observed_at":"2026-08-12T19:21:59.179579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18234","last_updated":"2025-10-21T02:41:44Z","snapshot_observed_at":"2026-07-06T22:33:39.148066Z","submitted_at":"2025-10-21T02:41:44Z","title":"DeepSeek-OCR: Contexts Optical Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.18234","snapshot_observed_at":"2026-08-12T19:21:59.189384Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.189384Z"},"links":{"cited_paper":"/paper/2510.18234","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:1e42edbce96473b317c126f50d6c52502991f5b7e568dc4ed5895cc5c2101887","observation_id":"adc69345-6af4-49d4-be9c-d20a6219a7af","resolution":{"observed_at":"2026-08-12T19:21:59.189384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08791","last_updated":"2026-04-15T06:01:13Z","snapshot_observed_at":"2026-08-12T13:00:59.980975Z","submitted_at":"2025-08-12T09:45:19Z","title":"Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.08791","snapshot_observed_at":"2026-08-12T19:21:59.195991Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.195991Z"},"links":{"cited_paper":"/paper/2508.08791","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:d396c2b06a6d430a44db26133274bf4c34bc21c3f4f9a442479b614f84fc713c","observation_id":"0a24fd01-5bb2-49dc-9b7f-205d925dea79","resolution":{"observed_at":"2026-08-12T19:21:59.195991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-08-12T08:24:59.243273Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-08-12T19:21:59.203762Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models , journal =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.203762Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:2651173e9c81a0d4c29cc53857bdbb43712cf66946857bccb24cb2137cf2fd4e","observation_id":"2c123124-ae6f-400b-ad14-e6cb13f5a139","resolution":{"observed_at":"2026-08-12T19:21:59.203762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-12T19:21:59.213050Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.213050Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:4d746ed6cd282f7733f00a5273b05ba0e24a6f6b8ce5beb310379b32ab7cecdb","observation_id":"10870325-622c-473c-b126-934be6591ef0","resolution":{"observed_at":"2026-08-12T19:21:59.213050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:59.219235Z","title":"2024 , url=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.219235Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:dc36c9fcff8ed2e5a57d193ac7f9d55d2513d2ff9813d041cc445f04a1962bc5","observation_id":"b581982a-1e51-4025-b3d5-e08152b243f8","resolution":{"observed_at":"2026-08-12T19:21:59.219235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:59.225271Z","title":"2023 , url=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.225271Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:5d6536302d0ab645561bf1c240c739708ab06da008dd007858823a11359d5308","observation_id":"478158d4-3e28-4940-9f30-97e5f055682d","resolution":{"observed_at":"2026-08-12T19:21:59.225271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-08-13T04:25:38.282910Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-12T19:21:59.232907Z","title":"Code Llama: Open Foundation Models for Code , journal =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.232907Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:5a51ee4a4a8e9edb96962469675e2ca13f6193c78adf843b63b85acd77483b6c","observation_id":"24e30cd2-de56-4bd5-8032-d86f246dcfc0","resolution":{"observed_at":"2026-08-12T19:21:59.232907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:59.238846Z","title":"ToolHop:","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.238846Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:4ccc1c9471de30d5f160c40997f33682f7f43a453818668e0619e08d89e8742a","observation_id":"3a52fc40-6cf4-4664-a5e6-d87f60e13b2b","resolution":{"observed_at":"2026-08-12T19:21:59.238846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:59.245764Z","title":"2023 , url=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.245764Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:b43f9a29ff074fe4bbeb66f04a915d10b07170b446808ff0e4b6b79e2827ad8c","observation_id":"bd455ddb-5ec9-46e5-8f49-1a32cc7c7b27","resolution":{"observed_at":"2026-08-12T19:21:59.245764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:59.252278Z","title":"T-Eval: Evaluating the Tool Utilization Capability of Large Language Models Step by Step , booktitle =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.252278Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:da5262f2f03ddfcd277e71d6aad8eefe3e9ff5e39a43e14ceee9611d6f5f4335","observation_id":"44819e06-aebc-406c-9097-bb6d2c07442b","resolution":{"observed_at":"2026-08-12T19:21:59.252278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:21:59.257857Z","title":"TaskBench: Benchmarking Large Language Models for Task Automation , booktitle =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-12T19:21:59.257857Z"},"links":{"citing_paper":"/paper/2608.10692"},"observation_digest":"sha256:c7e6089948ada7811b5cb7c2cfc3c7b9ced8fdf40da5a814c9a29c48b356b601","observation_id":"4081df13-c0af-4874-95c5-8689dd87b6c1","resolution":{"observed_at":"2026-08-12T19:21:59.257857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.10692","last_updated":"2026-08-11T09:14:53Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T09:25:45.501827Z","submitted_at":"2026-08-11T09:14:53Z","title":"SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":94,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":218},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 100 of 218 outbound references and 0 inbound Pith citation observations for arXiv:2608.10692."}