{"as_of":"2026-08-18T16:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f99e4c2f15a055be07c3774cc9583660c5495eba90406600cab72bf34ebc056e","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:21:49.742464Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.18373/citation-record","integrity":"/paper/2504.18373/integrity","json":"/paper/2504.18373/citation-record.json","paper":"/paper/2504.18373"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.505296Z","title":null,"venue":null,"work_id":"08b66dab-93e8-4061-b7bf-07a52a421942","year":2023},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.522561Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:69f3780aef9d9ff36aec847781ce234a598f1b44b9b0418dfa209936dd7d6c12","observation_id":"c156dc7e-6ed6-4b74-91d1-87c78db29521","resolution":{"observed_at":"2026-08-16T10:21:50.509931Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.489644Z","title":null,"venue":null,"work_id":"67977a15-b109-462b-a8a6-81671d12766e","year":2023},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.528161Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:63fe15b49ab9b26c0986284a814400e8562cee7c3a83a6343e9a53d4a23313bc","observation_id":"015fdd4d-1705-4e28-8348-9b0c773d601a","resolution":{"observed_at":"2026-08-16T10:21:50.494563Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:49.533166Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.533166Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:7882cf20330c8964fad2951f65717ff439a70ff80f79f8d0b332d145a5990fc9","observation_id":"4dd197c8-8bc7-4f79-b078-49ee3b715fcb","resolution":{"observed_at":"2026-08-16T10:21:49.533166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13205","last_updated":"2020-11-26T09:58:20Z","snapshot_observed_at":"2026-08-16T19:03:07.751236Z","submitted_at":"2020-11-26T09:58:20Z","title":"SLURP: A Spoken Language Understanding Resource Package","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13205","snapshot_observed_at":"2026-08-16T10:21:49.538421Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.538421Z"},"links":{"cited_paper":"/paper/2011.13205","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:7521d6b2de13b9fa5e33a2d048b239c5b4ed0daecfa7303fac2034ea844b5dbf","observation_id":"fb5c8bfb-5e45-4792-8afd-476692746c0f","resolution":{"observed_at":"2026-08-16T10:21:49.538421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.463627Z","title":"Karlsson, Jie Fu, and Yemin Shi","venue":null,"work_id":"a39010b9-0c3b-4265-8090-1b76238bd860","year":2023},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.544165Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:1fd724f085414275f21a98e3a7cbca96708663fc92f77788caee7c360086c734","observation_id":"34acdfb8-8948-488a-88a4-5fa86552c19e","resolution":{"observed_at":"2026-08-16T10:21:50.468598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13679","last_updated":"2024-08-05T13:32:40Z","snapshot_observed_at":"2026-08-16T14:07:59.009036Z","submitted_at":"2024-03-20T15:38:36Z","title":"SocialBench: Sociality Evaluation of Role-Playing Conversational Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13679","snapshot_observed_at":"2026-08-16T10:21:49.548950Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.548950Z"},"links":{"cited_paper":"/paper/2403.13679","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:3afd4da7462db81e6b9d3f59c620fa87d8b510610382ab1625cab3ce37077ab4","observation_id":"2c445e23-9c31-4d10-b101-2477def26874","resolution":{"observed_at":"2026-08-16T10:21:49.548950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.447020Z","title":null,"venue":null,"work_id":"565fdbe7-f37b-441b-9b28-0dfb2b84914e","year":2023},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.554881Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:2ca2e18a7350c5a0466f7d97a62fe6c5e626e3cc4b5d05ab799a3cc560cff500","observation_id":"b0cc72bf-b43c-4998-97e8-d86b4e65eaca","resolution":{"observed_at":"2026-08-16T10:21:50.452158Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14033","last_updated":"2024-01-15T03:18:25Z","snapshot_observed_at":"2026-08-18T10:53:24.646048Z","submitted_at":"2023-12-21T17:02:06Z","title":"T-Eval: Evaluating the Tool Utilization Capability of Large Language Models Step by Step","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14033","snapshot_observed_at":"2026-08-16T10:21:49.559531Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.559531Z"},"links":{"cited_paper":"/paper/2312.14033","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:0149441d2fec4d39dfe244b618e725c207d86b92f0f05c3776a5d2601f9fb656","observation_id":"85a838aa-2b5d-47c4-b51b-f4cd430916fa","resolution":{"observed_at":"2026-08-16T10:21:49.559531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.431903Z","title":null,"venue":null,"work_id":"11d266bc-2d91-441a-aea5-593f6093f52a","year":2021},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.564412Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:b61f4e521a91dbc24fa7a36c64721abe96b14efe4c8fba92b2a0741ceeb9b72a","observation_id":"3c5a4096-ddb7-490b-aaa3-117e728085fa","resolution":{"observed_at":"2026-08-16T10:21:50.436560Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.415888Z","title":null,"venue":null,"work_id":"aa3bf263-69b6-4c99-96e8-f302f22a1816","year":2020},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.569557Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:8891abb4e1ff7e98a39845af1b9521e00ed5d5eefbb754437187c5c7e929c28c","observation_id":"b85ba02a-dc27-494c-a67f-489f9833ec1d","resolution":{"observed_at":"2026-08-16T10:21:50.420907Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.14025","last_updated":"2021-03-25T17:59:08Z","snapshot_observed_at":"2026-08-16T18:36:17.823043Z","submitted_at":"2021-03-25T17:59:08Z","title":"The ThreeDWorld Transport Challenge: A Visually Guided Task-and-Motion Planning Benchmark for Physically Realistic Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.14025","snapshot_observed_at":"2026-08-16T10:21:49.574221Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.574221Z"},"links":{"cited_paper":"/paper/2103.14025","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:6df1e1ed5e80c56371ee8f67407a41bb3847f261cb47fae42d9b583f1508d96a","observation_id":"2641f43a-6fc5-41f5-b9e7-8a8285eb3128","resolution":{"observed_at":"2026-08-16T10:21:49.574221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:49.579498Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.579498Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:38a2fa62d2e1ea3b4dc5e0b481de3111d1ae3773b659258e00999f73f4949dc9","observation_id":"877ef9a1-0fba-4f1d-b5c8-c344ba955b4b","resolution":{"observed_at":"2026-08-16T10:21:49.579498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:49.584061Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.584061Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:e9506461cc3cddc32f060262d270ddc611e4607eb6860796b5fc35ec2705b343","observation_id":"5f17253d-2e6e-4977-acb0-51487026adcc","resolution":{"observed_at":"2026-08-16T10:21:49.584061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:49.589122Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.589122Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:f30fb0af234bf7843cc447d9bc157d89a3935e09909e5e38ca4a93dab1f5a99e","observation_id":"f4fdcbde-831e-43a6-b9d1-f687fa3d11e5","resolution":{"observed_at":"2026-08-16T10:21:49.589122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.06370","last_updated":"2021-12-13T01:38:37Z","snapshot_observed_at":"2026-08-16T17:35:14.947984Z","submitted_at":"2021-12-13T01:38:37Z","title":"Dependency Learning for Legal Judgment Prediction with a Unified Text-to-Text Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.06370","snapshot_observed_at":"2026-08-16T10:21:49.594019Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.594019Z"},"links":{"cited_paper":"/paper/2112.06370","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:ba93ed85e948d9396f14ae92c9794c78e19d90d5cc11e91f58945300888e32f2","observation_id":"11a6ab6d-8f57-4c2c-8a83-99c17ee45cc1","resolution":{"observed_at":"2026-08-16T10:21:49.594019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.390168Z","title":null,"venue":null,"work_id":"51012719-6f4b-47d9-8814-dd71ff4c6196","year":2022},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.599372Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:85cb995a44dfe43241aeb7435b2b49b399917e5ce56996ea42ed8471aa8bfca6","observation_id":"7e0f9369-7e28-444f-bd69-bfc758cc39a4","resolution":{"observed_at":"2026-08-16T10:21:50.395005Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.374354Z","title":null,"venue":null,"work_id":"10bb9dba-dce4-4040-983b-8105198ce553","year":2023},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.603742Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:f0a65d471f45cd8ea1e89765d856fe26d3285cdbd3f8d9047302d7df29506599","observation_id":"6e5f86e8-855a-4bdc-acf4-a6343d4775fd","resolution":{"observed_at":"2026-08-16T10:21:50.379226Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:49.608287Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.608287Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:1698ad93be0404fd2c763a32ce8891e00a935007abcb49c294d7670862655e03","observation_id":"88d105b9-4570-4e9c-bf91-5753b44c2ccb","resolution":{"observed_at":"2026-08-16T10:21:49.608287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17259","last_updated":"2024-12-23T04:02:46Z","snapshot_observed_at":"2026-08-13T17:31:34.764750Z","submitted_at":"2024-12-23T04:02:46Z","title":"LegalAgentBench: Evaluating LLM Agents in Legal Domain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17259","snapshot_observed_at":"2026-08-16T10:21:49.612806Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.612806Z"},"links":{"cited_paper":"/paper/2412.17259","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:dbadcb44d8e5cf6e93216fc4b51cc939297f59ac8befc10c5248cdfc0ebdeec7","observation_id":"0c03efc8-bd85-4918-8bd4-433f24b69ccc","resolution":{"observed_at":"2026-08-16T10:21:49.612806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-16T00:51:32.846970Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-16T10:21:49.618129Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.618129Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:d44df00c8cacf25416a1e92848ed7342e55d78da470b6ff522736364188a2b29","observation_id":"04809457-7820-40d8-a757-9cd31398669a","resolution":{"observed_at":"2026-08-16T10:21:49.618129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.348411Z","title":null,"venue":null,"work_id":"cf932b34-6960-45bb-9849-ce884be8843e","year":2021},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.623014Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:e4dd81576864f05f780b2931e1837c9c44a4ccd9f4e34437a9fa2bbb6825d5d3","observation_id":"0e7b7072-5e61-4435-ba8a-66e39a48eb5c","resolution":{"observed_at":"2026-08-16T10:21:50.353104Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15538","last_updated":"2024-02-23T06:25:20Z","snapshot_observed_at":"2026-08-17T05:45:32.513069Z","submitted_at":"2024-02-23T06:25:20Z","title":"AgentLite: A Lightweight Library for Building and Advancing Task-Oriented LLM Agent System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15538","snapshot_observed_at":"2026-08-16T10:21:49.627727Z","title":"Choubey, Tian Lan, Jason Wu, Huan Wang, Shelby Heinecke, Caiming Xiong, and Silvio Savarese","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.627727Z"},"links":{"cited_paper":"/paper/2402.15538","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:4710f9bd0f597c59a4e680bb0dc690e46ddd4737949f444d8c0ad7b95c992989","observation_id":"f6db415f-51f3-4d21-8d4a-0c3bbeeb5618","resolution":{"observed_at":"2026-08-16T10:21:49.627727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13178","last_updated":"2024-12-23T20:12:48Z","snapshot_observed_at":"2026-08-16T14:25:01.697568Z","submitted_at":"2024-01-24T01:51:00Z","title":"AgentBoard: An Analytical Evaluation Board of Multi-turn LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13178","snapshot_observed_at":"2026-08-16T10:21:49.632677Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.632677Z"},"links":{"cited_paper":"/paper/2401.13178","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:362e40d270d40c2011d8520ac59ef8b49432d0bf08262eb0bd1895670f5258f9","observation_id":"4e0e3555-0c4b-4f9c-a788-5509a31e6f93","resolution":{"observed_at":"2026-08-16T10:21:49.632677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19346","last_updated":"2024-11-23T08:23:27Z","snapshot_observed_at":"2026-08-16T13:06:02.218179Z","submitted_at":"2024-10-25T07:04:16Z","title":"AgentSense: Benchmarking Social Intelligence of Language Agents through Interactive Scenarios","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19346","snapshot_observed_at":"2026-08-16T10:21:49.637334Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.637334Z"},"links":{"cited_paper":"/paper/2410.19346","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:7267d1c04345a00b606f7c5f6ab2a4efb5357f3e519fa4d1ae86eb3bf7264873","observation_id":"74897ccd-d215-45be-a25c-6e765aa93845","resolution":{"observed_at":"2026-08-16T10:21:49.637334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.09890","last_updated":"2021-05-03T13:08:55Z","snapshot_observed_at":"2026-08-16T19:12:16.718235Z","submitted_at":"2020-10-19T21:48:31Z","title":"Watch-And-Help: A Challenge for Social Perception and Human-AI Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.09890","snapshot_observed_at":"2026-08-16T10:21:49.642253Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.642253Z"},"links":{"cited_paper":"/paper/2010.09890","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:042d210e8c1a5665b6aab1548ce9f2d68042ae3df6189f23a002be0bad159d2c","observation_id":"8ffce89e-d73f-495d-bc6c-3539ddb5f646","resolution":{"observed_at":"2026-08-16T10:21:49.642253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10568","last_updated":"2024-03-12T08:24:37Z","snapshot_observed_at":"2026-08-16T14:26:13.642769Z","submitted_at":"2024-01-19T09:14:11Z","title":"CivRealm: A Learning and Reasoning Odyssey in Civilization for Decision-Making Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10568","snapshot_observed_at":"2026-08-16T10:21:49.646995Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.646995Z"},"links":{"cited_paper":"/paper/2401.10568","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:38670d46d1f45e8d4bd3c1bbc1187925513887c09837190ae0dcb88014e8124b","observation_id":"860a4597-4aff-4de8-8921-635bbdd4bdd5","resolution":{"observed_at":"2026-08-16T10:21:49.646995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16789","last_updated":"2023-10-03T14:45:48Z","snapshot_observed_at":"2026-08-16T04:18:30.717622Z","submitted_at":"2023-07-31T15:56:53Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16789","snapshot_observed_at":"2026-08-16T10:21:49.651776Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.651776Z"},"links":{"cited_paper":"/paper/2307.16789","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:a1349fcc287a1f41c9d2f9de4154f2599369fcea9890c3802ec6deed33ed41df","observation_id":"30f61f55-cba1-4e3f-a883-b3206a34dc19","resolution":{"observed_at":"2026-08-16T10:21:49.651776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.332416Z","title":null,"venue":null,"work_id":"af0b6290-ca0c-4d1b-8356-11f6e2df0c66","year":2017},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.657683Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:51dea68c518d04073781d45a4efa29e09826e7482ae187737d5548ad97ebf786","observation_id":"65828b5f-b308-497c-8aba-6460a924827f","resolution":{"observed_at":"2026-08-16T10:21:50.337117Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03197","last_updated":"2022-08-05T14:35:03Z","snapshot_observed_at":"2026-08-16T16:40:55.924005Z","submitted_at":"2022-08-05T14:35:03Z","title":"Low-Resource Dense Retrieval for Open-Domain Question Answering: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":"2208.03197","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.03197","snapshot_observed_at":"2026-08-16T10:21:49.878898Z","title":"Low-Resource Dense Retrieval for Open-Domain Question Answering: A Comprehensive Survey","venue":"cs.CL","work_id":"b60f285e-b1ae-404a-9d91-cc8f66162626","year":2022},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.662196Z"},"links":{"cited_paper":"/paper/2208.03197","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:cf3ccf56b01be2891f167da2d15b2455c6c3c7af5c2c0471e64acf0d6b770c17","observation_id":"b4443859-4aa1-4012-81a0-67a318826652","resolution":{"observed_at":"2026-08-16T10:21:49.885984Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.316311Z","title":"Alfworld: Aligning text and embodied environments for interactive learning","venue":null,"work_id":"6a6b4a9e-0b3e-4046-9e2e-e76fce3be195","year":2021},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.666985Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:feaa4ca265d83cc33e09f9ecced68d67f7e1f481161a582b8818e77de253de8d","observation_id":"eb57d2ce-ed14-4550-ac75-507f288f3fb1","resolution":{"observed_at":"2026-08-16T10:21:50.321635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.299950Z","title":null,"venue":null,"work_id":"4f8c08ba-c689-4abb-8b40-989f8e3f3b33","year":2018},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.671377Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:3b813e6a7bae74f126350528a18978830be0c6d0d45d3e004011203129ee08a5","observation_id":"a9f2111f-9563-4345-8202-27e2c972e4b4","resolution":{"observed_at":"2026-08-16T10:21:50.305262Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06563","last_updated":"2024-04-05T06:39:34Z","snapshot_observed_at":"2026-08-16T14:11:03.298420Z","submitted_at":"2024-03-11T10:05:29Z","title":"Unraveling the Mystery of Scaling Laws: Part I","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06563","snapshot_observed_at":"2026-08-16T10:21:49.676047Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.676047Z"},"links":{"cited_paper":"/paper/2403.06563","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:977f5e6b4215675e938306535dcb48093ae71ba40619dc8cba69f6b7629926e3","observation_id":"b888589a-edab-4c13-83c9-95aeadb831cc","resolution":{"observed_at":"2026-08-16T10:21:49.676047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15971","last_updated":"2024-08-28T17:43:55Z","snapshot_observed_at":"2026-08-16T13:23:07.998172Z","submitted_at":"2024-08-28T17:43:55Z","title":"BattleAgentBench: A Benchmark for Evaluating Cooperation and Competition Capabilities of Language Models in Multi-Agent Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15971","snapshot_observed_at":"2026-08-16T10:21:49.681539Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.681539Z"},"links":{"cited_paper":"/paper/2408.15971","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:8a8630d0d30a838916dc67c3304dbcfd8f944467d75734e9733bd072615c3b08","observation_id":"54ca6850-b338-4c94-b88e-acb57778a5e9","resolution":{"observed_at":"2026-08-16T10:21:49.681539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:49.686442Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.686442Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:99caba22f1312f30af7c167b20fc0d1b473eaafbd62d89b8bbc649c7eafaf74d","observation_id":"d34c7846-0827-4394-bdd9-fc5385dcd1e1","resolution":{"observed_at":"2026-08-16T10:21:49.686442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:49.691274Z","title":"White, Doug Burger, and Chi Wang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.691274Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:87e15197d0a5ebac5ef3f62db599135ad93b082f8b74022c617a745910553446","observation_id":"da51cf25-e026-403e-94b0-021d7af6ea23","resolution":{"observed_at":"2026-08-16T10:21:49.691274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.262626Z","title":null,"venue":null,"work_id":"ee446d58-4932-455f-b0c5-5e2ac83c3daa","year":2020},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.696426Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:f35645a694d2f18a5eb18ad097f7a0e5600b908e6554dc437d497830d7b4e26e","observation_id":"da0fd5ff-ca9e-4824-84d3-1e5d500f95b3","resolution":{"observed_at":"2026-08-16T10:21:50.267655Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08562","last_updated":"2024-11-27T12:25:28Z","snapshot_observed_at":"2026-08-16T14:43:16.257066Z","submitted_at":"2023-11-14T21:46:27Z","title":"MAgIC: Investigation of Large Language Model Powered Multi-Agent in Cognition, Adaptability, Rationality and Collaboration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08562","snapshot_observed_at":"2026-08-16T10:21:49.700947Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.700947Z"},"links":{"cited_paper":"/paper/2311.08562","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:116be9bb1777a476cfb917cd374f7856080f5c2510b268679e9269ff91365c77","observation_id":"9588de65-7616-4efb-8f96-fdabfd61b7e4","resolution":{"observed_at":"2026-08-16T10:21:49.700947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.246572Z","title":null,"venue":null,"work_id":"db2c7dcf-0b6b-490a-bada-713a5d7cd049","year":2017},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.706236Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:a35c3b86610ffde2fa775fceff19219ed42feba5b47240b9c71e2e645efefb14","observation_id":"3d884cf5-218e-47da-bf2a-9a9c8f64c5a2","resolution":{"observed_at":"2026-08-16T10:21:50.251556Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00741","last_updated":"2024-12-05T07:05:59Z","snapshot_observed_at":"2026-08-16T17:40:14.613190Z","submitted_at":"2024-01-01T12:49:36Z","title":"ToolEyes: Fine-Grained Evaluation for Tool Learning Capabilities of Large Language Models in Real-world Scenarios","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00741","snapshot_observed_at":"2026-08-16T10:21:49.710862Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.710862Z"},"links":{"cited_paper":"/paper/2401.00741","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:2df5cea909d9c080963c395a18bfd44aaf7020c59125c1ef6f34de03f2d4f5b3","observation_id":"2b4826c8-68ad-4577-a980-ad5f6d85dd6d","resolution":{"observed_at":"2026-08-16T10:21:49.710862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08745","last_updated":"2021-12-16T09:54:23Z","snapshot_observed_at":"2026-08-16T17:34:09.043887Z","submitted_at":"2021-12-16T09:54:23Z","title":"Knowledge-enhanced Session-based Recommendation with Temporal Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08745","snapshot_observed_at":"2026-08-16T10:21:49.715495Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.715495Z"},"links":{"cited_paper":"/paper/2112.08745","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:be812b77551fce3b58752cf2dbfadba5361314ee5d61886a12a40fa2ea37b023","observation_id":"a289ea0b-7601-4b88-8f19-cbf8ca91265f","resolution":{"observed_at":"2026-08-16T10:21:49.715495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:49.720901Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.720901Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:e77df2e9b5cae79d806549fdf03629e12d578a8300228f718509d0d1a1c036fa","observation_id":"c46572cd-07ab-4574-95ad-8b5e73b72c83","resolution":{"observed_at":"2026-08-16T10:21:49.720901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.219579Z","title":null,"venue":null,"work_id":"f47716d6-be20-4ce0-956e-54c069aeb813","year":2023},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.725651Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:8ef090b9512ffda88555c2ac4dda952ebc96970daae457beaa5eb9822a855b94","observation_id":"2b452bd1-b991-4a2a-9189-3a8a484554d1","resolution":{"observed_at":"2026-08-16T10:21:50.224775Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.203497Z","title":null,"venue":null,"work_id":"299f7d4a-0159-488e-8672-db90bd7eea06","year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.731191Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:e61fa1c2229ee35898b97d4a9c3e7e140bcefa875899b47e1e4b48b7368e9c41","observation_id":"f5f49c78-7ecd-4ab4-9bfd-5c07af9187b4","resolution":{"observed_at":"2026-08-16T10:21:50.208632Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:49.737029Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.737029Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:6a84951a38bd2bda9bc68884d305aecf8ec8c86ce2ff6da1beb8b74e61008af4","observation_id":"32ad9263-a574-4a58-9895-dd6b0988f1f2","resolution":{"observed_at":"2026-08-16T10:21:49.737029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:49.742464Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.742464Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:0215dfce1e17153561613ef4f23dffbb3f00b1eb609f11e957989b842d4b3a60","observation_id":"d2ba333d-237a-4bfb-b996-5cce6c3d5794","resolution":{"observed_at":"2026-08-16T10:21:49.742464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T10:54:05.734042Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2504.18373."}