{"as_of":"2026-08-05T18:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:edaa97fe899884eb00d6b204a57f7ff188401ffdf1a592d06036b55405c9145a","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T00:23:03.822300Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.15054/citation-record","integrity":"/paper/2607.15054/integrity","json":"/paper/2607.15054/citation-record.json","paper":"/paper/2607.15054"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-02T00:23:00.973913Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:00.973913Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:4f94fdfa3fc5dab2b96a8e07ce3c697d93f7573772e02d8982011be0f2712eeb","observation_id":"4afc75ac-6588-4b67-9378-2ffc5ef46892","resolution":{"observed_at":"2026-08-02T00:23:00.973913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10370","last_updated":"2024-11-18T08:29:08Z","snapshot_observed_at":"2026-08-05T04:37:45.202508Z","submitted_at":"2024-05-16T18:03:41Z","title":"Grounded 3D-LLM with Referent Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10370","snapshot_observed_at":"2026-08-02T00:23:01.210993Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understanding reasoning and planning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.210993Z"},"links":{"cited_paper":"/paper/2405.10370","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:4149e574c13ff7b9dd611f4f31c5eb265ca7d2b631486c976b3a6ce333a6eb5a","observation_id":"f649197a-b618-408a-87f8-e57038564a1e","resolution":{"observed_at":"2026-08-02T00:23:01.210993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-01T22:27:48.245449Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-02T00:23:01.362939Z","title":"Scene-llm: Extending language model for 3d visual understanding and reasoning.arXiv preprint arXiv:2403.11401,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.362939Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:184fea4fd32ecc6183c555f83f934f59557cac6a5d2b438e4788ab70fed12b05","observation_id":"e8b896e1-377a-4bf6-b5de-c6c188cc415e","resolution":{"observed_at":"2026-08-02T00:23:01.362939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-07-06T17:01:04.895441Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-02T00:23:01.530176Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers.arXiv preprint arXiv:2312.08168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.530176Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:3dbe584b55f84cdcf979347ed025f6a5738cb0244308b40ed3d6a33b40341f15","observation_id":"4675c47a-7b5a-4ab3-b24f-83a706477a0e","resolution":{"observed_at":"2026-08-02T00:23:01.530176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-02T00:23:01.696722Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.696722Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:54ceb0f45f60c5d711c60ea43fd0331ae3ee2b8b391a6c8bf3c2fce38d1556af","observation_id":"05707b40-b89d-40bf-8e03-39d0298d5072","resolution":{"observed_at":"2026-08-02T00:23:01.696722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-02T00:23:01.780480Z","title":"Adam: A method for stochastic optimization.arXiv preprint arXiv:1412.6980,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.780480Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:1efffe667d6b824703e0c427c470c9c20688a84ac66ac53126f03ee7f198d00d","observation_id":"87e64744-d2a1-4358-87b8-233278902a8f","resolution":{"observed_at":"2026-08-02T00:23:01.780480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06037","last_updated":"2026-05-01T09:36:02Z","snapshot_observed_at":"2026-07-06T22:44:46.690576Z","submitted_at":"2026-02-05T18:59:32Z","title":"Thinking with Geometry: Active Geometry Integration for Spatial Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.06037","snapshot_observed_at":"2026-08-02T00:23:01.948198Z","title":"Thinking with geometry: Active geometry integration for spatial reasoning.arXiv preprint arXiv:2602.06037,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.948198Z"},"links":{"cited_paper":"/paper/2602.06037","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:42a329155b08b6ee9b1b63714586f5b7244b2d48ffcd05855a8c7f34735c83d6","observation_id":"5e88b47d-566b-43b7-9ad8-e1851429c6fc","resolution":{"observed_at":"2026-08-02T00:23:01.948198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10647","last_updated":"2025-11-13T18:59:53Z","snapshot_observed_at":"2026-07-06T22:35:46.018050Z","submitted_at":"2025-11-13T18:59:53Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.10647","snapshot_observed_at":"2026-08-02T00:23:02.051394Z","title":"Depth anything 3: Recovering the visual space from any views","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:02.051394Z"},"links":{"cited_paper":"/paper/2511.10647","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:9c32e99e8e7940931c817a899898b48e32078f940b01601cdb6089f138e8274a","observation_id":"2f189430-0882-4be4-8ef6-5b005ae1de66","resolution":{"observed_at":"2026-08-02T00:23:02.051394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:23:02.211902Z","title":"Trace anything: Representing any video in 4d via trajectory fields.arXiv preprint arXiv:2510.13802, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:02.211902Z"},"links":{"citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:54ff537b9daf2c770d445142497cfbfe4ba726bc7874c79244cc0b4043cd4e49","observation_id":"4a7fe89a-a414-4b7c-9969-fa9de197a021","resolution":{"observed_at":"2026-08-02T00:23:02.211902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01805","last_updated":"2025-05-21T09:38:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-02T15:12:17Z","title":"SpaceR: Reinforcing MLLMs in Video Spatial Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01805","snapshot_observed_at":"2026-08-02T00:23:02.322345Z","title":"Spacer: Reinforcing mllms in video spatial reasoning.arXiv preprint arXiv:2504.01805,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:02.322345Z"},"links":{"cited_paper":"/paper/2504.01805","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:d4ffd12c3dfdb52cbd333e6b8761d9e4f3242edc2e50a82d052372bcf84edd53","observation_id":"bf8cbbc5-f5d1-4423-802f-21ab9d50271a","resolution":{"observed_at":"2026-08-02T00:23:02.322345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01428","last_updated":"2025-03-11T07:54:04Z","snapshot_observed_at":"2026-08-04T09:46:24.709821Z","submitted_at":"2025-01-02T18:59:59Z","title":"GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01428","snapshot_observed_at":"2026-08-02T00:23:02.432874Z","title":"Gpt4scene: Understand 3d scenes from videos with vision- language models.arXiv preprint arXiv:2501.01428,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:02.432874Z"},"links":{"cited_paper":"/paper/2501.01428","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:45dd2495b82fddacf701942594a41f5257c181cbacce9c349cd69dc8e6a830d4","observation_id":"d3b06a84-d677-4a0a-9a70-d483a1a880cd","resolution":{"observed_at":"2026-08-02T00:23:02.432874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-02T00:23:02.519901Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:02.519901Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:fc6c4d784be0d5079da7f4fbacc8d1047aff15914094a882de8841956b1b8e7b","observation_id":"edf82e13-76f9-433c-902f-45a4153ecd22","resolution":{"observed_at":"2026-08-02T00:23:02.519901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-02T00:23:02.675732Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:02.675732Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:19b17af569c6f8c3c97cc9c1da769bad1086ea76db2d7c61c36e07fbf186fc69","observation_id":"2cac0151-ae00-4379-8ced-26b44dd6e06d","resolution":{"observed_at":"2026-08-02T00:23:02.675732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-02T00:23:02.835659Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:02.835659Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:b364041be0aeac659c66c0cbf45ddd1aba15a7666c8e6b1efff582805920d18b","observation_id":"21e08e6c-d6e8-46fa-afc1-3e2ea1de8f1b","resolution":{"observed_at":"2026-08-02T00:23:02.835659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-02T00:23:03.003520Z","title":"Ross3d: Reconstructive visual instruction tuning with 3d-awareness","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:03.003520Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:799c00b10bb61ccdf638206a6797e418ece0d02fb2e8000d84bd2ad6cfccc106","observation_id":"ce1e85c9-3eed-47d0-9f27-d9e51c7d7277","resolution":{"observed_at":"2026-08-02T00:23:03.003520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08769","last_updated":"2023-08-17T03:52:15Z","snapshot_observed_at":"2026-08-02T00:22:05.597306Z","submitted_at":"2023-08-17T03:52:15Z","title":"Chat-3D: Data-efficiently Tuning Large Language Model for Universal Dialogue of 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08769","snapshot_observed_at":"2026-08-02T00:23:03.164292Z","title":"Chat-3d: Data-efficiently tuning large language model for universal dialogue of 3d scenes.arXiv preprint arXiv:2308.08769,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:03.164292Z"},"links":{"cited_paper":"/paper/2308.08769","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:9dc27bf5b8887e8820e6fb7f6b49277e384a936a5bb925ae5dd7bfe9d6ef4910","observation_id":"f91d52c3-b8c2-47b3-a065-f8004863312e","resolution":{"observed_at":"2026-08-02T00:23:03.164292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.19235","last_updated":"2026-07-17T06:42:00Z","snapshot_observed_at":"2026-08-02T17:54:03.255042Z","submitted_at":"2026-03-19T17:59:58Z","title":"Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.19235","snapshot_observed_at":"2026-08-02T00:23:03.278174Z","title":"Generation models know space: Unleashing implicit 3d priors for scene understanding.arXiv preprint arXiv:2603.19235,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:03.278174Z"},"links":{"cited_paper":"/paper/2603.19235","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:ce04cc5d8c3a6a9316cd9460af69801d0a938c7188722090a87d700651964aa9","observation_id":"a94d5c6e-44f2-4f55-b3f5-195fd52981b0","resolution":{"observed_at":"2026-08-02T00:23:03.278174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:23:03.437035Z","title":"From flatland to space: Teaching vision-language models to perceive and reason in 3d.arXiv preprint arXiv:2503.22976,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:03.437035Z"},"links":{"citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:97d7d0f6caaad2cd3d3fcdafd7fe944b8f78de27172fb141005aa890d4ab0bb0","observation_id":"7437ff82-5dab-4f3b-bb6f-57ef258a53b1","resolution":{"observed_at":"2026-08-02T00:23:03.437035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.27437","last_updated":"2026-05-02T17:42:29Z","snapshot_observed_at":"2026-08-02T12:27:33.147868Z","submitted_at":"2026-03-28T22:49:40Z","title":"SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.27437","snapshot_observed_at":"2026-08-02T00:23:03.547032Z","title":"Spatialstack: Layered geometry-language fusion for 3d vlm spatial reasoning.arXiv preprint arXiv:2603.27437,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:03.547032Z"},"links":{"cited_paper":"/paper/2603.27437","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:d119925b591c3dc62a80bce72e3647443525b4711da2286badba083d5b5dd3d6","observation_id":"a305829a-724f-4163-949f-21405c8dc6f3","resolution":{"observed_at":"2026-08-02T00:23:03.547032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-07-06T18:36:12.298104Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-02T00:23:03.658491Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:03.658491Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:f8395c76f818744ddf98cafc52f59f6af6b0aee14bf116547cdee6292b97fd3c","observation_id":"65a174ab-bebd-457d-9885-22696f41c3b0","resolution":{"observed_at":"2026-08-02T00:23:03.658491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:23:03.740289Z","title":"Multi3drefer: Grounding text description to multiple 3d objects","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:03.740289Z"},"links":{"citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:1a394a3f7b35fffd64a5029a9dd46c8a3f24795b3ac24194dc44ecc2f04a178e","observation_id":"9ffbde95-a8de-47a6-b3f6-8568ef4d81d3","resolution":{"observed_at":"2026-08-02T00:23:03.740289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:23:03.822300Z","title":"Unifying 3d vision-language understanding via promptable queries","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:03.822300Z"},"links":{"citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:04bb0e2aadda505fb3f63ce2f71911ef1dc47dff2f937e18055d13ad0138da92","observation_id":"c7f2432c-0cb8-4974-abe2-f3bc6d064307","resolution":{"observed_at":"2026-08-02T00:23:03.822300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-02T00:23:01.864475Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.864475Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:4c24072a683b0af7d0b977b48a263d273e96b61afa5217631c2f72a7d1768aa6","observation_id":"c891bda5-50ec-4552-b0e0-f6f66ad68479","resolution":{"observed_at":"2026-08-02T00:23:01.864475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:23:01.120140Z","title":"Seeing through imagination: Learning scene geometry via implicit spatial world modeling.arXiv preprint arXiv:2512.01821,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.120140Z"},"links":{"citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:ba2f14c4c284bf2ce3080bc233d4fc06c512f95ec2da0497f1daec0cf10b154c","observation_id":"c4ec22de-4f42-4007-8a85-dc08415a53dc","resolution":{"observed_at":"2026-08-02T00:23:01.120140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T00:23:01.048543Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.048543Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:4908872b4e47071a67ad9d2102ee36d93d4b9ee4215604f4269e02b44471a5f5","observation_id":"99ea6e02-6a1d-4020-adf5-02c703efe42a","resolution":{"observed_at":"2026-08-02T00:23:01.048543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:23:01.613098Z","title":"3drs: Mllms need 3d-aware representation supervision for scene understanding.arXiv preprint arXiv:2506.01946,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.613098Z"},"links":{"citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:bc493d59ca9e7ea86c281c4c9124796e2d9c7efc692378ede60d296298b197e1","observation_id":"71d197b1-e280-443c-b1c5-c20763002696","resolution":{"observed_at":"2026-08-02T00:23:01.613098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-02T00:23:01.446109Z","title":"Point-bind & point-llm: Aligning point cloud with multi- modality for 3d understanding, generation, and instruction following.arXiv preprint arXiv:2309.00615,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.446109Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:85d18542a98fcafbfc6360a843778af05b6751ad6743a08658d4b299a264e1ca","observation_id":"4ba8b9c3-c4ab-43e9-9f7c-f875897ca14e","resolution":{"observed_at":"2026-08-02T00:23:01.446109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-02T00:23:01.277839Z","title":"Vlm-3r: Vision-language models augmented with instruction-aligned 3d reconstruction.arXiv preprint arXiv:2505.20279,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.277839Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:8ca384bb75de1bc10346072944274658cd01ed57c047167695625e514ad83c8a","observation_id":"3a027346-4e82-4a16-966d-da6358e1aa4e","resolution":{"observed_at":"2026-08-02T00:23:01.277839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00883","last_updated":"2025-04-14T20:12:57Z","snapshot_observed_at":"2026-07-06T21:02:28.100677Z","submitted_at":"2025-04-01T15:11:11Z","title":"Improved Visual-Spatial Reasoning via R1-Zero-Like Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00883","snapshot_observed_at":"2026-08-02T00:23:01.979540Z","title":"Improved visual-spatial reasoning via r1-zero-like training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.979540Z"},"links":{"cited_paper":"/paper/2504.00883","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:6de655890519c0b780606cc962160e25d88d52c400271ebf008579e2c96e3012","observation_id":"8c4a1fa3-70d6-499e-b42b-d96f56b54eb2","resolution":{"observed_at":"2026-08-02T00:23:01.979540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2607.15054."}