{"as_of":"2026-08-18T08:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:444f0a7c70311c148dbc1de56ea9a61f6d87d7d2a7b2f3ba1b6b83ecc52760a3","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:53:52.775348Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-08T03:13:07.963343Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T03:14:31.636817Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"cited_work":{"arxiv_id":"2604.10506","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.10506","snapshot_observed_at":"2026-07-08T03:14:31.636817Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","venue":"cs.AI","work_id":"07a49f23-eba6-4cf1-adad-fa126e89df34","year":2026},"citing_paper":{"arxiv_id":"2607.06522","last_updated":"2026-07-07T17:27:59Z","snapshot_observed_at":"2026-08-15T08:05:47.608523Z","submitted_at":"2026-07-07T17:27:59Z","title":"Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-08T03:13:07.963343Z"},"links":{"cited_paper":"/paper/2604.10506","citing_paper":"/paper/2607.06522"},"observation_digest":"sha256:28ab795d6b918dee52ebb022730b06c5c71a1f0d1e917c143005f404abfba99c","observation_id":"59ab3e84-c3b9-4ca9-9af7-0014f97de02f","resolution":{"observed_at":"2026-07-08T03:14:31.638468Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.10506/citation-record","integrity":"/paper/2604.10506/integrity","json":"/paper/2604.10506/citation-record.json","paper":"/paper/2604.10506"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-16T04:42:52.370966Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":"2503.06669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-07-10T23:07:47.895730Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","venue":"cs.RO","work_id":"f797e9ec-510f-43a7-8a0c-18009ce332e5","year":2025},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:337ad13ea97a65b9739b40faa93391e613ebaa7c930c00bbfb920e81e8c80c51","observation_id":"e0f9d5f2-4935-4446-8273-5f7f78ed5520","resolution":{"observed_at":"2026-05-11T15:09:24.919963Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08623","last_updated":"2025-03-10T16:17:30Z","snapshot_observed_at":"2026-08-16T13:35:01.742308Z","submitted_at":"2024-07-11T16:00:22Z","title":"Surpassing Cosine Similarity for Multidimensional Comparisons: Dimension Insensitive Euclidean Metric","version":4},"cited_work":{"arxiv_id":"2407.08623","doi":"10.48550/arxiv.2407.08623","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08623","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"One-Vision, Any-Resolution: A General Framework for High-Resolution Vision-Language Understanding.arXiv preprint arXiv:2407.08623, 2024a","venue":"arXiv (Cornell University)","work_id":"6e508327-3b58-47ea-a1e7-74d814382f81","year":null},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2407.08623","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:57b431f2601a54034d4c310535fb80077109c869a409b5814f985769ba71b351","observation_id":"39d35e26-3360-410a-8325-7721fc702ca9","resolution":{"observed_at":"2026-05-11T09:41:01.794011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-08-09T05:23:26.365677Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":"1706.02677","doi":"10.48550/arxiv.1706.02677","metadata_source":"pith","pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","venue":"cs.CV","work_id":"f3dc32a4-cf81-467b-8ff4-3b2f21d3bf1f","year":2017},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:5aebe6e47e60a197c6a6611678f918db59163005bcb1cee79f522c30967f595c","observation_id":"804dfea6-33a5-482d-8986-eef411c84a4e","resolution":{"observed_at":"2026-05-12T07:20:31.604247Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:09.485311+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:09.485311+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13064","last_updated":"2024-05-29T00:00:25Z","snapshot_observed_at":"2026-08-18T07:52:58.330154Z","submitted_at":"2024-05-29T00:00:25Z","title":"On the modification and revocation of open source licences","version":1},"cited_work":{"arxiv_id":"2407.13064","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.13064","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SEED-1.6: A Comprehensive Multimodal Large Language Model for Diverse Tasks and Long-Context Understanding.arXiv preprint arXiv:2407.13064","venue":null,"work_id":"93ead54d-ac6a-400f-bdad-1e99d39131fa","year":null},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2407.13064","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:7577d2ba0e7ec4935b1acf11c30851dd6d7134bba22067da8950e61d181bb245","observation_id":"9e6523ea-ac96-4fe2-9022-b7d9c3b5fddc","resolution":{"observed_at":"2026-05-11T09:41:01.822915Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":"2412.04468","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-07-04T16:39:58.306201Z","title":"NVILA: Efficient Frontier Visual Language Models","venue":"cs.CV","work_id":"a8e505f5-ef0f-4236-b69a-2647902e00d7","year":2024},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:c0725a4c26939965964adbb3ef9724609638560ce5ffd8a47c34fe158a0d76b9","observation_id":"2b981b61-9835-4d9f-ad5f-fac46f34d757","resolution":{"observed_at":"2026-05-11T09:41:01.759826Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:3838e4c570baf64a327e56cdb639b742eb8e881a730bf1383855c9a866abf6f7","observation_id":"c1f6976b-ab0d-48b3-9060-0279b1ac953a","resolution":{"observed_at":"2026-05-11T09:41:01.855632Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16435","last_updated":"2023-05-25T19:20:19Z","snapshot_observed_at":"2026-08-16T15:29:34.272204Z","submitted_at":"2023-05-25T19:20:19Z","title":"Composing Bridges","version":1},"cited_work":{"arxiv_id":"2305.16435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.16435","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Perception Test: A Diagnostic Benchmark for Multimodal Models.arXiv preprint arXiv:2305.16435","venue":null,"work_id":"02288670-eb8f-4996-acc1-fd3193d4baa1","year":null},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2305.16435","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:81f6c56cd88dd82e518d0b93438be157606e3c6571622e82a9a0d6b7fd58b0d1","observation_id":"1aacd13c-734c-4295-91bc-01ac0155a1c6","resolution":{"observed_at":"2026-05-11T09:41:01.896580Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02981","last_updated":"2024-06-07T08:44:52Z","snapshot_observed_at":"2026-08-16T13:46:00.907207Z","submitted_at":"2024-06-05T06:23:49Z","title":"Local vs. Global Interpretability: A Computational Complexity Perspective","version":2},"cited_work":{"arxiv_id":"2406.02981","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.02981","snapshot_observed_at":"2026-07-02T19:27:18.545706Z","title":"Video-CoT: A Multimodal Chain of Thought Agent for Video Reasoning.arXiv preprint arXiv:2406.02981","venue":null,"work_id":"32572514-b483-4e39-a46b-88186224206e","year":null},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2406.02981","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:eebb4cc328cc81907b6c6fc27d8a22f5d9f03a327dcff636bd00b2808d6f96b4","observation_id":"6a4c00ee-46b3-40e3-8923-71ae8a9a5fbd","resolution":{"observed_at":"2026-05-11T09:41:01.785215Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03229","last_updated":"2024-08-16T02:46:32Z","snapshot_observed_at":"2026-08-18T04:38:39.802178Z","submitted_at":"2024-04-04T06:29:42Z","title":"Relation between the keV-MeV and TeV emission of GRB 221009A and its implications","version":2},"cited_work":{"arxiv_id":"2404.03229","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.03229","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward-VLM: A Reward-centric Vision-Language Model for Autonomous Driving.arXiv preprint arXiv:2404.03229","venue":null,"work_id":"b6a3fd12-11d6-459e-a157-a5027ab41048","year":null},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2404.03229","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:3b16316dd0c753bca6f8a22c01abf4387da6452fcdc11a58ca32370ebe2b2170","observation_id":"883bd1eb-44d5-42f6-af33-99d11bbb71a6","resolution":{"observed_at":"2026-05-11T09:41:01.838513Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":"2412.10302","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-07-10T13:27:05.559849Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","venue":"cs.CV","work_id":"0fa0432e-2510-462b-954d-436d3b669375","year":2024},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:3be328f63c48d82d16caaca0cd29eb6d297e098ca640445a10e4ca003759c4af","observation_id":"25f711df-b3a4-4442-a632-63840a22a4b8","resolution":{"observed_at":"2026-05-11T10:09:32.945221Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07750","last_updated":"2023-08-15T13:06:34Z","snapshot_observed_at":"2026-08-16T15:08:22.764074Z","submitted_at":"2023-08-15T13:06:34Z","title":"Novel $H(\\mathrm{sym} \\mathrm{Curl})$-conforming finite elements for the relaxed micromorphic sequence","version":1},"cited_work":{"arxiv_id":"2308.07750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.07750","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Skylark: A Multi-modal Large Language Model for General-purpose Instruction Following.arXiv preprint arXiv:2308.07750","venue":null,"work_id":"32d27bd5-a850-4bfe-99e7-33b541381d47","year":null},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2308.07750","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:742b6011f06e7a9e2b2d68caed7b370cb104fcecc0f90be504a650b9994b6409","observation_id":"deb80c75-d03d-45a0-88dd-ebb85acb1217","resolution":{"observed_at":"2026-05-11T09:41:01.903053Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16270","last_updated":"2024-05-25T15:14:01Z","snapshot_observed_at":"2026-08-16T13:49:27.935097Z","submitted_at":"2024-05-25T15:14:01Z","title":"Complexity of Multiple-Hamiltonicity in Graphs of Bounded Degree","version":1},"cited_work":{"arxiv_id":"2405.16270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16270","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"X.-E., and Levine, S","venue":null,"work_id":"0b086eae-9b31-4e11-863d-2311deb398c3","year":null},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2405.16270","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:459403eb2ce8ddd25b0b560ad798d1b3272614c326be71352ab6d43cdd76f8a9","observation_id":"c5baa0f4-c316-431b-a70e-765a69a39388","resolution":{"observed_at":"2026-05-11T09:41:01.890769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23764","last_updated":"2026-05-23T03:42:56Z","snapshot_observed_at":"2026-08-13T16:52:15.861245Z","submitted_at":"2025-05-29T17:59:52Z","title":"MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence","version":3},"cited_work":{"arxiv_id":"2505.23764","doi":"10.48550/arxiv.2505.23764","metadata_source":"pith","pith_arxiv_id":"2505.23764","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mmsi-bench: A benchmark for multi-image spatial intelligence","venue":"cs.CV","work_id":"3c86b01a-2b7e-4a70-94c5-92bf4d05ad52","year":2025},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2505.23764","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:5046fdc1da41ce0d10b94e9975ea2df78c15b9104673057576d5db7f339f781f","observation_id":"2bde0eae-ac20-40cc-90b1-de24c00cd0b9","resolution":{"observed_at":"2026-05-26T02:02:26.295966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-08-11T00:52:12.225793Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:379cb3c26fde5128d07c3f3e961eb864b1a30a57064c1dd25bbe6ff5eea160e9","observation_id":"51135fcb-62cc-4db5-ac2e-48761b49e915","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00493","last_updated":"2025-03-27T10:30:42Z","snapshot_observed_at":"2026-08-17T23:18:17.356871Z","submitted_at":"2024-11-30T14:28:53Z","title":"Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene Understanding","version":2},"cited_work":{"arxiv_id":"2412.00493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00493","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-3d llm: Learning position-aware video representation for 3d scene understanding","venue":null,"work_id":"da32fb5f-071c-46f1-8736-5e93c754d926","year":2024},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2412.00493","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:458448dc29c16280df74b099cf0cfb14f6221ec0776168ad4445d810198a966d","observation_id":"6f6f27bb-e7d2-4e8a-8ae7-ca3dc3495693","resolution":{"observed_at":"2026-05-11T09:41:01.809714Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":0,"verified_exact":11,"verified_fuzzy":0},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 1 inbound Pith citation observation for arXiv:2604.10506."}