{"as_of":"2026-08-08T10:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d46c186d2858227da8985f5971d3185c6a4f670595637859f0bbe38b2ce40d67","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:26:12.042623Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.14212/citation-record","integrity":"/paper/2506.14212/integrity","json":"/paper/2506.14212/citation-record.json","paper":"/paper/2506.14212"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-07T00:26:11.382113Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-07T00:15:43.462179Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.382113Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:10949bcddeef2701212f1f4a7907316a0a5768f99978b19698a1e7e8dff24793","observation_id":"385b030a-9cc5-4368-b3ea-06f97f901133","resolution":{"observed_at":"2026-08-07T00:26:11.382113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.582376Z","title":null,"venue":null,"work_id":"5cf493fb-f0b1-4e78-8b7c-1d2042c7bc41","year":2004},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-07T00:15:43.462179Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.414488Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:a19d025fbea552c19e77a27d7d7ff1c41e2601758f8a32bd485cf57f66b4e247","observation_id":"82f9cab2-a993-450d-a82c-562973a01e4e","resolution":{"observed_at":"2026-08-07T00:26:12.586059Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.570525Z","title":"W., Hamrick, J","venue":null,"work_id":"764eae07-f317-46ee-b98c-640199aca9eb","year":2013},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-07T00:15:43.462179Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.430076Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:95797695e435bc2ec468a10cb04d65c266b79df98c573e209120b1dd3d970da8","observation_id":"33b90856-ecce-43d1-af09-4f9abd663b79","resolution":{"observed_at":"2026-08-07T00:26:12.574404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.559299Z","title":"W., Jacobs, R","venue":null,"work_id":"269ae0b6-4869-4ad9-8e43-511107549cf3","year":2003},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-07T00:15:43.462179Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.457000Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:24b12e7ee42560a26d4decc9d80ece200e4a1a0eba2a14eb88256ac82ec34866","observation_id":"45f3a86f-a750-4e4b-aab4-5a1b06c41630","resolution":{"observed_at":"2026-08-07T00:26:12.563160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.546524Z","title":"A., & Wang, H","venue":null,"work_id":"8d2508f4-3c8c-49c7-9cd3-e686289c1385","year":2022},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-07T00:15:43.462179Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.481733Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:e78f0192ad363b8a4051d5afe9da94763649873a2ec964c70f760f89adb97141","observation_id":"ff9a41fd-a8b5-4214-8930-59fdd11c4630","resolution":{"observed_at":"2026-08-07T00:26:12.551047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.534550Z","title":") (2007)","venue":null,"work_id":"3c4a7651-312f-4004-9521-886523c62f23","year":2007},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-07T00:15:43.462179Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.509424Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:d4489d1f570d74a5b1e18d3e07dd87aa669176191372c02ee8ed3c7d344d37f4","observation_id":"5d32f3b0-2e87-4e9e-8d6c-33f4cca1fe19","resolution":{"observed_at":"2026-08-07T00:26:12.538873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.523466Z","title":null,"venue":null,"work_id":"b86370fe-7b26-4389-a82f-45d8c7e77e7d","year":2023},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-07T00:15:43.462179Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.536476Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:8ce07bd682ec1b8e5851c31d88c69653120d3cdf1488e38f9a311db035f780e9","observation_id":"94deb435-da9c-4961-a935-0acfedf1fabb","resolution":{"observed_at":"2026-08-07T00:26:12.527352Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.512754Z","title":null,"venue":null,"work_id":"f5687b24-57f8-4aa0-9deb-a7865f95398f","year":2002},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-07T00:15:43.462179Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.571412Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:fa3d4416807c6e6000b455037905e9e1a343911e6a921eea218f9b1403e64ea7","observation_id":"6234a868-4377-47f1-9dac-d17b2181f961","resolution":{"observed_at":"2026-08-07T00:26:12.516629Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.501218Z","title":"M., Ullman, T","venue":null,"work_id":"d9a9dba7-ce16-49e0-8274-b83d20ce0e9c","year":2017},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-07T00:15:43.462179Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.599864Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:b8cbd2d0502a4e74d750a5001b006f63f3c0d834ec3dcdc427823855b36a1384","observation_id":"2de0b570-b6ea-4a3c-9d0b-03930abaeb57","resolution":{"observed_at":"2026-08-07T00:26:12.505392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.489102Z","title":null,"venue":null,"work_id":"f7d042d3-7fb9-4bee-9c43-46ba388ec940","year":2015},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-07T00:15:43.462179Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.625314Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:f748bcdc2390d136e20e4488990a7af72c0e09ced70fb104dcd7cca9b65ec2e5","observation_id":"f91e5b18-bbd9-44f0-bf9b-b541749de1d7","resolution":{"observed_at":"2026-08-07T00:26:12.493610Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.475647Z","title":null,"venue":null,"work_id":"530dd8e8-f587-4610-890a-76b8c1aef0c4","year":2017},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-07T00:15:43.462179Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.652810Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:b22a9dd40e9ab2587b8055a7e71326d490403c617cbe437eabca8938be0da044","observation_id":"4c03ea8b-6d66-4090-92ae-3b4aa305d2f9","resolution":{"observed_at":"2026-08-07T00:26:12.480367Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.463688Z","title":"(1954).The construction of reality in the child","venue":null,"work_id":"2f63c691-329b-4072-a9b2-e694abcaf40b","year":1954},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-07T00:15:43.462179Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.679382Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:ad120c28de30d901502f0899bae6af21078373bd196e007ab0019bc75ef0a9ef","observation_id":"d90d9401-e5dd-4bdd-a372-e3a3e925b21e","resolution":{"observed_at":"2026-08-07T00:26:12.467654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.451911Z","title":null,"venue":null,"work_id":"5eefbcc7-9309-4013-86a0-971e1d0d6bde","year":2020},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-07T00:15:43.462179Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.707986Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:4536aaa629ad2c0614004fa1caba3ca45e6fa26e0fe7a99bf5b4289d7c4dfd89","observation_id":"2b8c91f8-036e-4bb4-a5d6-dc6aaf481042","resolution":{"observed_at":"2026-08-07T00:26:12.456216Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.437709Z","title":"Vinyals, O","venue":null,"work_id":"505fd326-74a1-4221-8bb8-1d82f348e3e6","year":2024},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-07T00:15:43.462179Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.735760Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:ae2d0ba089c28d141e9b514d8ff190d4a85ddd519ddc812b2809f1b75812c6a6","observation_id":"d33afa8b-8a6f-434f-bcc6-66c9f8b656d6","resolution":{"observed_at":"2026-08-07T00:26:12.442630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.394070Z","title":null,"venue":null,"work_id":"891a34ea-d8a6-45cd-9b29-949ee6e107cb","year":2011},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-07T00:15:43.462179Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.789656Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:1db42e490d281717f87c0b4881e9534778e97d462d80b34ea60ef5ebd6218672","observation_id":"26b4f656-d117-4b38-bbe4-c9f80fcceccb","resolution":{"observed_at":"2026-08-07T00:26:12.418058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06805","last_updated":"2024-01-18T07:31:47Z","snapshot_observed_at":"2026-07-06T17:14:57.853205Z","submitted_at":"2024-01-10T15:29:21Z","title":"Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06805","snapshot_observed_at":"2026-08-07T00:26:11.819243Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-07T00:15:43.462179Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.819243Z"},"links":{"cited_paper":"/paper/2401.06805","citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:e1d2a19e8abb33bb691caaf2a3eeef9baaeb4098553ae660fd090ca035559442","observation_id":"6a703fdf-aea1-4cd8-b995-2511481876bf","resolution":{"observed_at":"2026-08-07T00:26:11.819243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.323917Z","title":null,"venue":null,"work_id":"4958526f-c678-4059-8e87-e38b7e09a615","year":1968},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-07T00:15:43.462179Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.854736Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:71047bb6d1f3223387bf3d7f12ed79f308c044afb47b1e8b2e75b3de380fa465","observation_id":"f8d326f8-2c5d-41f5-9a3f-4f98747dacdb","resolution":{"observed_at":"2026-08-07T00:26:12.354975Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.263551Z","title":"G., & Sch¨on, T","venue":null,"work_id":"ad217052-6c32-4b2e-9117-3fae8e6a3b1e","year":2023},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-07T00:15:43.462179Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.882599Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:54614808844a27027c038ddca2a4b0ee5051f4cbeeb5687cf635984afc2df8df","observation_id":"bff810e1-39a8-422b-8031-6cb9d65c95be","resolution":{"observed_at":"2026-08-07T00:26:12.293289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12672","last_updated":"2023-06-23T06:05:31Z","snapshot_observed_at":"2026-07-06T15:45:24.674515Z","submitted_at":"2023-06-22T05:14:00Z","title":"From Word Models to World Models: Translating from Natural Language to the Probabilistic Language of Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12672","snapshot_observed_at":"2026-08-07T00:26:11.919119Z","title":"K., Goodman, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-07T00:15:43.462179Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.919119Z"},"links":{"cited_paper":"/paper/2306.12672","citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:162060b1ac4e71413f38b956055a3f2e22e32ba55562fbf1eefbae0de8772639","observation_id":"7de648e9-e30f-46eb-aaaf-8713c1da9f93","resolution":{"observed_at":"2026-08-07T00:26:11.919119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.199852Z","title":"H., & Tenenbaum, J","venue":null,"work_id":"e43a389f-8fbb-4630-b420-048af1fb1878","year":2016},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-07T00:15:43.462179Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.946607Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:f156af5bd8ec8846fcbe1485a9fbe193e7ba5b1f658510f1fc72becee6d9957c","observation_id":"268add9a-3b9d-4693-85f7-5783bf1003b6","resolution":{"observed_at":"2026-08-07T00:26:12.223542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14325","last_updated":"2023-06-27T23:26:47Z","snapshot_observed_at":"2026-08-05T15:59:44.935423Z","submitted_at":"2023-06-25T19:38:01Z","title":"The Neuro-Symbolic Inverse Planning Engine (NIPE): Modeling Probabilistic Social Inferences from Linguistic Inputs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14325","snapshot_observed_at":"2026-08-07T00:26:11.978908Z","title":"M., Wei, M., Zhang, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-07T00:15:43.462179Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:11.978908Z"},"links":{"cited_paper":"/paper/2306.14325","citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:29c413104c2cd45851df0d3e69a1aa89af1e00fe8efa63b3f5671520228a3776","observation_id":"5a6252c3-6065-4d88-b704-cf84f354cede","resolution":{"observed_at":"2026-08-07T00:26:11.978908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20502","last_updated":"2025-02-27T20:21:36Z","snapshot_observed_at":"2026-08-07T17:41:40.700286Z","submitted_at":"2025-02-27T20:21:36Z","title":"On Benchmarking Human-Like Intelligence in Machines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20502","snapshot_observed_at":"2026-08-07T00:26:12.008828Z","title":"L., & Tenenbaum, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-07T00:15:43.462179Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:12.008828Z"},"links":{"cited_paper":"/paper/2502.20502","citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:7dea1337c8176503af579fa5190c41a013a5dc17df6144d617fc04cd9f03f091","observation_id":"f1bfedf2-d615-4aa1-914d-daa2980f72f4","resolution":{"observed_at":"2026-08-07T00:26:12.008828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:12.146720Z","title":null,"venue":null,"work_id":"ca85ea06-6be4-45be-adb4-bd31ed09d5f6","year":2025},"citing_paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","snapshot_observed_at":"2026-08-07T00:15:43.462179Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:12.042623Z"},"links":{"citing_paper":"/paper/2506.14212"},"observation_digest":"sha256:d11fa393bdc8b6330aec974321e0a834684a70e19962499befc5e32ff5f1bb90","observation_id":"65aab872-1e94-48f3-b9f0-fb00abf8279d","resolution":{"observed_at":"2026-08-07T00:26:12.169526Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.14212","last_updated":"2025-06-17T06:03:44Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T00:15:43.462179Z","submitted_at":"2025-06-17T06:03:44Z","title":"What's in the Box? Reasoning about Unseen Objects from Multimodal Cues"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2506.14212."}