{"as_of":"2026-08-07T10:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0c43cee1ccf20550fcffcc8c1d3f02290115b232ee88cca767b95445f3f4bcb4","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:29:40.087802Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.10778/citation-record","integrity":"/paper/2507.10778/integrity","json":"/paper/2507.10778/citation-record.json","paper":"/paper/2507.10778"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.13642","last_updated":"2025-03-19T05:09:14Z","snapshot_observed_at":"2026-08-05T18:02:56.273979Z","submitted_at":"2024-06-19T15:41:30Z","title":"SpatialBot: Precise Spatial Understanding with Vision Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13642","snapshot_observed_at":"2026-08-06T17:29:38.536084Z","title":"Spatialbot: Precise spatial understanding with vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10778","last_updated":"2025-08-14T03:48:03Z","snapshot_observed_at":"2026-08-06T17:23:22.701464Z","submitted_at":"2025-07-14T20:05:55Z","title":"Warehouse Spatial Question Answering with LLM Agent","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:29:38.536084Z"},"links":{"cited_paper":"/paper/2406.13642","citing_paper":"/paper/2507.10778"},"observation_digest":"sha256:7166a598742aa42b832ebafd5f1534c8d45a0a6322d74168faa05b104200aaa6","observation_id":"e2ed1f8c-2a8d-4720-84e0-5316589660b5","resolution":{"observed_at":"2026-08-06T17:29:38.536084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:29:38.601314Z","title":"Spatialvlm: Endow- ing vision-language models with spatial reasoning capabili- ties","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10778","last_updated":"2025-08-14T03:48:03Z","snapshot_observed_at":"2026-08-06T17:23:22.701464Z","submitted_at":"2025-07-14T20:05:55Z","title":"Warehouse Spatial Question Answering with LLM Agent","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:29:38.601314Z"},"links":{"citing_paper":"/paper/2507.10778"},"observation_digest":"sha256:afc754a2b991506dc4177401464b2a7443036d5b0d67aca607f0fe10e77ddefa","observation_id":"8546b2a5-113b-4722-93f7-8bacdf1ba08e","resolution":{"observed_at":"2026-08-06T17:29:38.601314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:29:41.718267Z","title":"Spatial- rgpt: Grounded spatial reasoning in vision-language mod- els","venue":null,"work_id":"be62d0c4-c521-4fd3-8cc4-371b120c9cb4","year":2025},"citing_paper":{"arxiv_id":"2507.10778","last_updated":"2025-08-14T03:48:03Z","snapshot_observed_at":"2026-08-06T17:23:22.701464Z","submitted_at":"2025-07-14T20:05:55Z","title":"Warehouse Spatial Question Answering with LLM Agent","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:29:38.675477Z"},"links":{"citing_paper":"/paper/2507.10778"},"observation_digest":"sha256:47291a56547ec715f2909c754e23987160c0cb8dab34975dba46715a2a7bc0b0","observation_id":"454134af-8b06-4101-84ee-8f8796bd87a7","resolution":{"observed_at":"2026-08-06T17:29:41.903708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-06T17:29:38.751572Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10778","last_updated":"2025-08-14T03:48:03Z","snapshot_observed_at":"2026-08-06T17:23:22.701464Z","submitted_at":"2025-07-14T20:05:55Z","title":"Warehouse Spatial Question Answering with LLM Agent","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:29:38.751572Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2507.10778"},"observation_digest":"sha256:e33f573fe1d602a179cba02a8456622fa88c0b67dff17ee83d4f6410cf3f3c9a","observation_id":"82dec2ed-f7d3-4dc7-b385-6488c149875e","resolution":{"observed_at":"2026-08-06T17:29:38.751572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:29:38.866567Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.10778","last_updated":"2025-08-14T03:48:03Z","snapshot_observed_at":"2026-08-06T17:23:22.701464Z","submitted_at":"2025-07-14T20:05:55Z","title":"Warehouse Spatial Question Answering with LLM Agent","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:29:38.866567Z"},"links":{"citing_paper":"/paper/2507.10778"},"observation_digest":"sha256:1735db1ee06460cedb0e7c9458a5e217893923a60404f52ed1d928845aafc95c","observation_id":"b2839409-843e-4a79-8ea7-8a2741ae333b","resolution":{"observed_at":"2026-08-06T17:29:38.866567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20066","last_updated":"2025-06-24T23:58:20Z","snapshot_observed_at":"2026-08-06T22:55:09.041478Z","submitted_at":"2025-06-24T23:58:20Z","title":"ToSA: Token Merging with Spatial Awareness","version":1},"cited_work":{"arxiv_id":"2506.20066","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.20066","snapshot_observed_at":"2026-08-06T17:29:40.174642Z","title":"ToSA: Token Merging with Spatial Awareness","venue":"cs.CV","work_id":"fdd9354b-312d-4f55-ac77-d3bd25e98c6c","year":2025},"citing_paper":{"arxiv_id":"2507.10778","last_updated":"2025-08-14T03:48:03Z","snapshot_observed_at":"2026-08-06T17:23:22.701464Z","submitted_at":"2025-07-14T20:05:55Z","title":"Warehouse Spatial Question Answering with LLM Agent","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:29:38.951111Z"},"links":{"cited_paper":"/paper/2506.20066","citing_paper":"/paper/2507.10778"},"observation_digest":"sha256:d0e7f34d09233b8d2fd3c09f47dcfe6f1ba9052db2303d92bf4e3e91ea9117fc","observation_id":"91eac91c-5b43-4613-918e-ed4b68643fa5","resolution":{"observed_at":"2026-08-06T17:29:40.213090Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:29:41.557895Z","title":"Zero-shot 3d question answering via voxel-based dynamic token compres- sion","venue":null,"work_id":"d1b7b3c0-c061-40b7-a311-2494fce29396","year":2025},"citing_paper":{"arxiv_id":"2507.10778","last_updated":"2025-08-14T03:48:03Z","snapshot_observed_at":"2026-08-06T17:23:22.701464Z","submitted_at":"2025-07-14T20:05:55Z","title":"Warehouse Spatial Question Answering with LLM Agent","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:29:39.046690Z"},"links":{"citing_paper":"/paper/2507.10778"},"observation_digest":"sha256:d486e3f53f3d87608df993e4354e2e2a36b7e99b0490e2d9fb6fe26d7c11d8fe","observation_id":"9ab03bd5-fe61-43cb-9a85-e8ea79c7a311","resolution":{"observed_at":"2026-08-06T17:29:41.636975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:29:41.403842Z","title":"Embodied agent inter- face: Benchmarking llms for embodied decision making","venue":null,"work_id":"667a3a7f-6f4c-488b-abc4-1190afd4eafd","year":2024},"citing_paper":{"arxiv_id":"2507.10778","last_updated":"2025-08-14T03:48:03Z","snapshot_observed_at":"2026-08-06T17:23:22.701464Z","submitted_at":"2025-07-14T20:05:55Z","title":"Warehouse Spatial Question Answering with LLM Agent","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:29:39.147806Z"},"links":{"citing_paper":"/paper/2507.10778"},"observation_digest":"sha256:e46036049c0b370a3baba71596e1b5489f5b819aff7e7cea4d31724d5ae136a6","observation_id":"bea3ddf5-48cb-4953-a0a4-9a820e2facfb","resolution":{"observed_at":"2026-08-06T17:29:41.484786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:29:41.288098Z","title":"Seeground: See and ground for zero-shot open- vocabulary 3d visual grounding","venue":null,"work_id":"7ae77369-d255-4710-9d8a-34651331ca32","year":2025},"citing_paper":{"arxiv_id":"2507.10778","last_updated":"2025-08-14T03:48:03Z","snapshot_observed_at":"2026-08-06T17:23:22.701464Z","submitted_at":"2025-07-14T20:05:55Z","title":"Warehouse Spatial Question Answering with LLM Agent","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:29:39.240988Z"},"links":{"citing_paper":"/paper/2507.10778"},"observation_digest":"sha256:83dbf39fd28887683a60123aaf234a54e34c7b32105f6150857e507beddee939","observation_id":"c0645438-3102-44c6-be13-edce72644785","resolution":{"observed_at":"2026-08-06T17:29:41.340612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:29:39.339118Z","title":"Focal loss for dense object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.10778","last_updated":"2025-08-14T03:48:03Z","snapshot_observed_at":"2026-08-06T17:23:22.701464Z","submitted_at":"2025-07-14T20:05:55Z","title":"Warehouse Spatial Question Answering with LLM Agent","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:29:39.339118Z"},"links":{"citing_paper":"/paper/2507.10778"},"observation_digest":"sha256:b3ad55bc80c3738007cdcc5cdff9afddf8cc50a6b529114be7ef0b151d16f498","observation_id":"95ded4ad-249c-406d-b44a-c81945463e3c","resolution":{"observed_at":"2026-08-06T17:29:39.339118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:29:41.086146Z","title":null,"venue":null,"work_id":"fa8d3bf2-825d-406c-931c-7ff538e3d27e","year":2025},"citing_paper":{"arxiv_id":"2507.10778","last_updated":"2025-08-14T03:48:03Z","snapshot_observed_at":"2026-08-06T17:23:22.701464Z","submitted_at":"2025-07-14T20:05:55Z","title":"Warehouse Spatial Question Answering with LLM Agent","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:29:39.441137Z"},"links":{"citing_paper":"/paper/2507.10778"},"observation_digest":"sha256:c3ae36dcc4f9d3b608c94c63376cf3a5eb3c9b86a5567f139e67d46438387e36","observation_id":"b91428a8-af37-48e5-8393-4014bd586534","resolution":{"observed_at":"2026-08-06T17:29:41.171583Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:29:40.932550Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":"8df68932-9bc3-44b3-94df-e5d5248b8bfc","year":2024},"citing_paper":{"arxiv_id":"2507.10778","last_updated":"2025-08-14T03:48:03Z","snapshot_observed_at":"2026-08-06T17:23:22.701464Z","submitted_at":"2025-07-14T20:05:55Z","title":"Warehouse Spatial Question Answering with LLM Agent","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:29:39.531046Z"},"links":{"citing_paper":"/paper/2507.10778"},"observation_digest":"sha256:c6885a47d2f6f2b8b519293638d26bd7118074301151bf9eef2cd551eada1051","observation_id":"5fab6fd2-c228-419e-a7fa-02f60e1b36c3","resolution":{"observed_at":"2026-08-06T17:29:41.004358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:29:40.795035Z","title":"Vlm-grounder: A vlm agent for zero-shot 3d visual grounding","venue":null,"work_id":"725ec874-39ce-4a6f-aab6-e9120aad60b6","year":2024},"citing_paper":{"arxiv_id":"2507.10778","last_updated":"2025-08-14T03:48:03Z","snapshot_observed_at":"2026-08-06T17:23:22.701464Z","submitted_at":"2025-07-14T20:05:55Z","title":"Warehouse Spatial Question Answering with LLM Agent","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:29:39.602826Z"},"links":{"citing_paper":"/paper/2507.10778"},"observation_digest":"sha256:1fd2db0918d1fcb0c66dddc0ebf4742ef4ec6304f1cef7f319b075a5277cb7a9","observation_id":"0eb380ba-f903-4438-8451-a846145b6362","resolution":{"observed_at":"2026-08-06T17:29:40.857991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:29:40.660088Z","title":"Fouhey, and Joyce Chai","venue":null,"work_id":"38735fc9-bd3b-4a6f-82da-fdca6d25cffb","year":2024},"citing_paper":{"arxiv_id":"2507.10778","last_updated":"2025-08-14T03:48:03Z","snapshot_observed_at":"2026-08-06T17:23:22.701464Z","submitted_at":"2025-07-14T20:05:55Z","title":"Warehouse Spatial Question Answering with LLM Agent","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:29:39.706694Z"},"links":{"citing_paper":"/paper/2507.10778"},"observation_digest":"sha256:9f83629b806670f4ca5b18465bd93d3bf326347a484cb2796c872dd6b0750aac","observation_id":"fdd43a2f-1baa-469b-91e6-839abcf414f5","resolution":{"observed_at":"2026-08-06T17:29:40.724684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:29:39.837375Z","title":"Visual programming for zero-shot open-vocabulary 3d visual grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10778","last_updated":"2025-08-14T03:48:03Z","snapshot_observed_at":"2026-08-06T17:23:22.701464Z","submitted_at":"2025-07-14T20:05:55Z","title":"Warehouse Spatial Question Answering with LLM Agent","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:29:39.837375Z"},"links":{"citing_paper":"/paper/2507.10778"},"observation_digest":"sha256:f34af8a1b82d275bd83e7e436d00fc1fde610b7e44ac7bc6a292ebeb14482acc","observation_id":"8860a391-0e75-410b-af83-022e58746082","resolution":{"observed_at":"2026-08-06T17:29:39.837375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:29:40.543548Z","title":"Agent3d-zero: An agent for zero-shot 3d understanding","venue":null,"work_id":"8693be65-9bb9-4266-a319-145b836d78dd","year":2024},"citing_paper":{"arxiv_id":"2507.10778","last_updated":"2025-08-14T03:48:03Z","snapshot_observed_at":"2026-08-06T17:23:22.701464Z","submitted_at":"2025-07-14T20:05:55Z","title":"Warehouse Spatial Question Answering with LLM Agent","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:29:39.930124Z"},"links":{"citing_paper":"/paper/2507.10778"},"observation_digest":"sha256:b5d042f6b8f28b3c6ed7fe009b4a8e33dc3c0183f6c4db5cb942c9e80e22b636","observation_id":"1d12a078-4ada-4793-ac93-cdb943b2dae1","resolution":{"observed_at":"2026-08-06T17:29:40.590524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:29:40.395785Z","title":"See and think: Embodied agent in virtual environment","venue":null,"work_id":"b4436c6c-e6ea-4d36-87b2-d7081a1c885b","year":2024},"citing_paper":{"arxiv_id":"2507.10778","last_updated":"2025-08-14T03:48:03Z","snapshot_observed_at":"2026-08-06T17:23:22.701464Z","submitted_at":"2025-07-14T20:05:55Z","title":"Warehouse Spatial Question Answering with LLM Agent","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:29:40.024063Z"},"links":{"citing_paper":"/paper/2507.10778"},"observation_digest":"sha256:64810ef326f20e361f986245defe1bbf75bf26c9d6a413a54d1906a5b00c4e06","observation_id":"a4424dfe-9a38-4859-b3f6-9f00496230c5","resolution":{"observed_at":"2026-08-06T17:29:40.473966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:29:40.303548Z","title":"Video-3d llm: Learning position-aware video representation for 3d scene understanding","venue":null,"work_id":"7b97e061-a4aa-47fc-af76-52ff390e9132","year":2025},"citing_paper":{"arxiv_id":"2507.10778","last_updated":"2025-08-14T03:48:03Z","snapshot_observed_at":"2026-08-06T17:23:22.701464Z","submitted_at":"2025-07-14T20:05:55Z","title":"Warehouse Spatial Question Answering with LLM Agent","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:29:40.087802Z"},"links":{"citing_paper":"/paper/2507.10778"},"observation_digest":"sha256:5136684ba8680ae14150019355486915cf2ae478a6d936ad95c724919977cae1","observation_id":"bf329b4c-22fd-4676-8123-d4de0cb898f8","resolution":{"observed_at":"2026-08-06T17:29:40.349978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.10778","last_updated":"2025-08-14T03:48:03Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T17:23:22.701464Z","submitted_at":"2025-07-14T20:05:55Z","title":"Warehouse Spatial Question Answering with LLM Agent"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":1,"verified_fuzzy":10},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2507.10778."}