{"as_of":"2026-08-08T19:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:597cde790f1e12a4fe3ddddf2adeeb2f5a7fd3b49aa6cabc24e4d1b968fed5fa","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:23:56.322623Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T09:59:02.378826Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T14:48:32.614745Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"cited_work":{"arxiv_id":"2506.14471","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14471","snapshot_observed_at":"2026-07-03T14:48:32.614745Z","title":"Dense360: Dense understanding from omnidirectional panoramas","venue":null,"work_id":"cf1b9c30-a128-434b-a003-b7a06e06ec06","year":2025},"citing_paper":{"arxiv_id":"2605.13169","last_updated":"2026-05-15T16:50:42Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T08:31:22Z","title":"PanoWorld: Towards Spatial Supersensing in 360$^\\circ$ Panorama World","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-14T20:40:59.877854Z"},"links":{"cited_paper":"/paper/2506.14471","citing_paper":"/paper/2605.13169"},"observation_digest":"sha256:9a926be5c722f554e224aa8f33b6aaee8a7c7003e17c04442d5cd1b002254523","observation_id":"1b5bdbbc-14f6-4d15-b26f-aa9dc18a1628","resolution":{"observed_at":"2026-05-14T20:42:57.567508Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"cited_work":{"arxiv_id":"2506.14471","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14471","snapshot_observed_at":"2026-07-03T14:48:32.614745Z","title":"Dense360: Dense understanding from omnidirectional panoramas","venue":null,"work_id":"cf1b9c30-a128-434b-a003-b7a06e06ec06","year":2025},"citing_paper":{"arxiv_id":"2605.13169","last_updated":"2026-05-15T16:50:42Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T08:31:22Z","title":"PanoWorld: Towards Spatial Supersensing in 360$^\\circ$ Panorama World","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-19T16:57:03.172340Z"},"links":{"cited_paper":"/paper/2506.14471","citing_paper":"/paper/2605.13169"},"observation_digest":"sha256:5c6fb968574abbe68e6c12291cd2531fc04d4b6d1435c069a17061c7d95ff2f5","observation_id":"d18b3c03-058f-4fb2-b7ce-a6613df24e78","resolution":{"observed_at":"2026-05-19T16:57:40.064154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"cited_work":{"arxiv_id":"2506.14471","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14471","snapshot_observed_at":"2026-07-03T14:48:32.614745Z","title":"Dense360: Dense understanding from omnidirectional panoramas","venue":null,"work_id":"cf1b9c30-a128-434b-a003-b7a06e06ec06","year":2025},"citing_paper":{"arxiv_id":"2606.27745","last_updated":"2026-07-15T13:11:28Z","snapshot_observed_at":"2026-08-06T21:48:03.348041Z","submitted_at":"2026-06-26T05:54:38Z","title":"Panoramic Scene Understanding: A Survey from Distortion-Aware Engineering to Sphere-Native Modeling","version":1},"reference_index":141,"source":"pdf_text","source_observed_at":"2026-06-29T04:35:58.372801Z"},"links":{"cited_paper":"/paper/2506.14471","citing_paper":"/paper/2606.27745"},"observation_digest":"sha256:9601244754b4511e7067f70fbb54f1a292d9d5af11c64283e265662fedfd182e","observation_id":"3ab9d8fd-0a07-4b9b-96e7-967f7a35d735","resolution":{"observed_at":"2026-06-29T20:03:56.656459Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14471","snapshot_observed_at":"2026-08-02T09:59:02.378826Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27745","last_updated":"2026-07-15T13:11:28Z","snapshot_observed_at":"2026-08-06T21:48:03.348041Z","submitted_at":"2026-06-26T05:54:38Z","title":"Panoramic Scene Understanding: A Survey from Distortion-Aware Engineering to Sphere-Native Modeling","version":2},"reference_index":137,"source":"pdf_text","source_observed_at":"2026-08-02T09:59:02.378826Z"},"links":{"cited_paper":"/paper/2506.14471","citing_paper":"/paper/2606.27745"},"observation_digest":"sha256:57c46c67de57d8a320a463f7ca45b7b88c688e72936664059395323b76cf09df","observation_id":"54ee12cd-47b0-4a95-b8db-ccb515c3969f","resolution":{"observed_at":"2026-08-02T09:59:02.378826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"cited_work":{"arxiv_id":"2506.14471","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14471","snapshot_observed_at":"2026-07-03T14:48:32.614745Z","title":"Dense360: Dense understanding from omnidirectional panoramas","venue":null,"work_id":"cf1b9c30-a128-434b-a003-b7a06e06ec06","year":2025},"citing_paper":{"arxiv_id":"2606.30378","last_updated":"2026-06-29T14:38:20Z","snapshot_observed_at":"2026-07-07T00:04:15.048683Z","submitted_at":"2026-06-29T14:38:20Z","title":"OmniCoT: A Benchmark for Global and Multi-Step Panoramic Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T06:11:09.693576Z"},"links":{"cited_paper":"/paper/2506.14471","citing_paper":"/paper/2606.30378"},"observation_digest":"sha256:e783bfe8c45c800461c1e6b4f49e807176784ebf8d917d17510cd5260b350fe5","observation_id":"f8fe511e-517b-4919-84df-b8aaffa6e0ba","resolution":{"observed_at":"2026-06-30T06:14:19.099103Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"cited_work":{"arxiv_id":"2506.14471","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14471","snapshot_observed_at":"2026-07-03T14:48:32.614745Z","title":"Dense360: Dense understanding from omnidirectional panoramas","venue":null,"work_id":"cf1b9c30-a128-434b-a003-b7a06e06ec06","year":2025},"citing_paper":{"arxiv_id":"2607.02497","last_updated":"2026-07-02T17:56:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-07-02T17:56:49Z","title":"Seek to Segment: Active Perception for Panoramic Referring Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-03T14:39:22.617747Z"},"links":{"cited_paper":"/paper/2506.14471","citing_paper":"/paper/2607.02497"},"observation_digest":"sha256:55110af92aa373cfdc92634f7a6848f2de8a2dd2acffe6fc7d5cb7132e4dde79","observation_id":"5a7cc748-3773-4ead-af02-2aebbaf69429","resolution":{"observed_at":"2026-07-03T14:48:32.616438Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.14471/citation-record","integrity":"/paper/2506.14471/integrity","json":"/paper/2506.14471/citation-record.json","paper":"/paper/2506.14471"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:44.783957Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:44.783957Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:ce96ca40a8ffbbe2c972dfd364b490fc8c9cb8f04b3610bbe21b93cdd419bf21","observation_id":"be959be0-fd34-433c-879b-a19b0dea03a1","resolution":{"observed_at":"2026-08-07T00:23:44.783957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T00:23:44.894729Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:44.894729Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:bc2455f94f07204865b9b144b9ab911cafe84d319a3088c5ddc0a3a9fe96196c","observation_id":"32651995-8b8b-4b38-bb7f-fb3a06f05882","resolution":{"observed_at":"2026-08-07T00:23:44.894729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:13.230419Z","title":"Egok360: A 360 egocentric kinetic human activity video dataset","venue":null,"work_id":"9eef88fe-11f9-42c6-aba7-5c68a7effd1f","year":2020},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:45.040131Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:373ec7a2fd77af199135541f0e332de62f70e1e106ce9b4f2871d26eb00236e9","observation_id":"d782884f-cb52-4fbb-bcf0-99f2239acf1a","resolution":{"observed_at":"2026-08-07T00:24:13.236515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:13.210398Z","title":"Language models are few-shot learners","venue":null,"work_id":"f5155f11-0557-48f5-9211-af473157075d","year":2020},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:45.177845Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:b7329af6a0c2ff35bc762a5e6e18f95f1bce83d9f240ccab895ce23663c9932c","observation_id":"b58307fd-d846-45d3-869d-45d9bdfe7d55","resolution":{"observed_at":"2026-08-07T00:24:13.217242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:13.188321Z","title":"Vip-llava: Making large multimodal models understand arbitrary visual prompts","venue":null,"work_id":"eec01018-30ff-4058-83d7-dbbafd4cc55f","year":2024},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:45.360969Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:be4c5ed4e9633636344959202de3c876105491748d4361ea238c569389f76778","observation_id":"2efea0fe-10d2-4afa-a7c8-8d93ffec022c","resolution":{"observed_at":"2026-08-07T00:24:13.195601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:13.167963Z","title":"Opening the vocabulary of egocentric actions","venue":null,"work_id":"ea735775-dc9a-41cc-9baf-916d175b0892","year":2023},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:45.530771Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:bd82f643b63b94ab136a8815f47c798a6a28e5f04b69221466678950f32cf831","observation_id":"e06b2259-2878-4394-bbee-b8d8f3106961","resolution":{"observed_at":"2026-08-07T00:24:13.173880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:13.145791Z","title":"360+ x: A panoptic multi-modal scene understanding dataset","venue":null,"work_id":"ccb9beb3-712c-473d-99e5-983b6c61ba50","year":2024},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:45.704852Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:c6c3ec0d97d53b2cbf11be69ca2108d4f60cd78c4e3f6aae845d6b92e597c1c5","observation_id":"ef5e3b6e-7fe4-40e6-98df-9a0ce3677068","resolution":{"observed_at":"2026-08-07T00:24:13.151865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:13.126172Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":"bac94ea9-7dde-4824-8513-2d884bde1d65","year":2024},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:45.880885Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:8e0c05764cda21abd68b00b495f749c41d93566412ea863d4c2426ab6f821b70","observation_id":"26f582a5-c38a-45e7-aa96-6de5a82ce19f","resolution":{"observed_at":"2026-08-07T00:24:13.131630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:13.106453Z","title":"A single transformer for scalable vision-language modeling","venue":null,"work_id":"42fa4728-a637-4d67-aec9-290334f26673","year":2024},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:46.057569Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:0cd9823d20267a5d4c7276556e21774e863ff1c7654d7f2f78603396b7c1b166","observation_id":"5515e812-0aa4-467d-9042-d40818a0e3c8","resolution":{"observed_at":"2026-08-07T00:24:13.112148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T00:23:46.230089Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:46.230089Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:052ca5efe4acfe6c25ab6b1f7b3e68fdc3ab17f937bf4e61be5e01a9ce84c987","observation_id":"024bfd26-8b25-4130-b75b-49c1909b4e08","resolution":{"observed_at":"2026-08-07T00:23:46.230089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:46.465672Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:46.465672Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:c80174e753951fd05476e5e5cd3d3aaf5e845f6eb1428e03f058eca37d0d650f","observation_id":"5d60de1d-15f5-4b49-8a54-0f40757cf88a","resolution":{"observed_at":"2026-08-07T00:23:46.465672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:13.077153Z","title":"Embodied artificial intelligence","venue":null,"work_id":"f66c72a4-def3-44f4-b20a-d012784f5d28","year":2003},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:46.644826Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:4a0645e4d0bb088552c56ac40ec143344054ff5d31b81884d25543723d6e3090","observation_id":"72f191dc-7804-499f-9b05-e489c452f06a","resolution":{"observed_at":"2026-08-07T00:24:13.083055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:13.057515Z","title":"Xtuner: A toolkit for efficiently fine-tuning llm.https://github.com/InternLM/ xtuner, 2023","venue":null,"work_id":"7b7b97f2-332b-4e92-bfe3-58b9c9028c8e","year":2023},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:46.809159Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:5c257eee62da89bb9d13851bd52c4ba242adb1c15a6ce9f5ec4ea2e90a981f20","observation_id":"b7511b78-29ba-4bc9-ae2a-aebebb6fba4e","resolution":{"observed_at":"2026-08-07T00:24:13.064321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-07T00:23:47.061342Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning.arXiv preprint arXiv:2305.06500, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:47.061342Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:63d98e3561181d294db6678fb0526be3e485612388d0ea6c3037dbdd68de3aa3","observation_id":"904a8184-0bd6-453c-aa97-d7264b97eaa6","resolution":{"observed_at":"2026-08-07T00:23:47.061342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:13.036542Z","title":"Bert: Pre-training of deep bidirec- tional transformers for language understanding","venue":null,"work_id":"a16b764c-eddb-4fb7-a2fe-8e8d459ed7a8","year":2019},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:47.220128Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:6c463d0d1a66e28be4c25fce4d6840741a33f02a6d12538f379484e1bf30a310","observation_id":"b5b82210-91d2-4cd0-bd0d-8d67505002d6","resolution":{"observed_at":"2026-08-07T00:24:13.043410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-07T00:23:47.368477Z","title":"Unveiling encoder-free vision-language models.arXiv preprint arXiv:2406.11832, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:47.368477Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:1bc80ae3ecc112afe0a80205a60fc5cc8aa876ceb79f09e8128c92f9b9431c3b","observation_id":"6a10af03-a77f-46dc-9977-4ebbbfb433b1","resolution":{"observed_at":"2026-08-07T00:23:47.368477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-08T14:17:36.435110Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06788","snapshot_observed_at":"2026-08-07T00:23:47.528488Z","title":"Evev2: Improved baselines for encoder-free vision-language models.arXiv preprint arXiv:2502.06788, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:47.528488Z"},"links":{"cited_paper":"/paper/2502.06788","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:6930d8611cd115525f1e51b7083f8042ba1032a5687440c6a67787b172d097cd","observation_id":"debf2a9a-6d76-491b-8c8b-dd7dab277001","resolution":{"observed_at":"2026-08-07T00:23:47.528488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11326","last_updated":"2025-04-21T07:23:45Z","snapshot_observed_at":"2026-08-07T16:02:06.665915Z","submitted_at":"2025-04-15T16:02:47Z","title":"PVUW 2025 Challenge Report: Advances in Pixel-level Understanding of Complex Videos in the Wild","version":2},"cited_work":{"arxiv_id":"2504.11326","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11326","snapshot_observed_at":"2026-08-07T00:23:57.971684Z","title":"PVUW 2025 Challenge Report: Advances in Pixel-level Understanding of Complex Videos in the Wild","venue":"cs.CV","work_id":"0d0d97ba-8811-457f-8a9c-d3fbb1edb614","year":2025},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:47.667164Z"},"links":{"cited_paper":"/paper/2504.11326","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:3ad7d55809426dc073d1c0f6c7ee95019821dfad33b01d11afc384bac5b95628","observation_id":"f2f86070-df66-42f5-a9d6-11c809cb46a6","resolution":{"observed_at":"2026-08-07T00:23:58.066400Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T00:23:47.847964Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:47.847964Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:932d7425e9ef923feb5b73eb2795ff1a50a31b2fc51de1fe0301be79ab7d81bb","observation_id":"cfb07893-49ad-4fd7-8635-d760cd3510ff","resolution":{"observed_at":"2026-08-07T00:23:47.847964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00358","last_updated":"2025-01-09T03:25:24Z","snapshot_observed_at":"2026-08-08T02:45:12.912568Z","submitted_at":"2024-12-31T09:22:38Z","title":"Embodied VideoAgent: Persistent Memory from Egocentric Videos and Embodied Sensors Enables Dynamic Scene Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00358","snapshot_observed_at":"2026-08-07T00:23:47.969877Z","title":"Embodied videoagent: Persistent memory from egocentric videos and embodied sensors enables dynamic scene understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:47.969877Z"},"links":{"cited_paper":"/paper/2501.00358","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:b56f525f53d0fdfe892f6832df9b7d9640ae9b64f98b4ad33bfc4c4e43eb945b","observation_id":"72ef7a60-4096-4597-8628-6641a99fa105","resolution":{"observed_at":"2026-08-07T00:23:47.969877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04620","last_updated":"2025-05-07T17:59:32Z","snapshot_observed_at":"2026-08-07T15:49:04.921787Z","submitted_at":"2025-05-07T17:59:32Z","title":"On Path to Multimodal Generalist: General-Level and General-Bench","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04620","snapshot_observed_at":"2026-08-07T00:23:48.104575Z","title":"On path to multimodal generalist: General-level and general-bench","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:48.104575Z"},"links":{"cited_paper":"/paper/2505.04620","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:54c95b92f6f6688a738b022466552ba18af70c1081d2130daefab90a58e1e06c","observation_id":"391054ec-1810-4d02-8d9e-4bf38407ecfb","resolution":{"observed_at":"2026-08-07T00:23:48.104575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:13.017084Z","title":"Scene-llm: Extending language model for 3d visual reasoning","venue":null,"work_id":"be09c408-7f2c-46c1-8fec-f2bf973e9531","year":2025},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:48.336325Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:c62c35240015be0587da7c21ee94389da2afef9cef642655c107f06661f550e5","observation_id":"5760e726-4493-4b38-9dc5-52cecefdc9a5","resolution":{"observed_at":"2026-08-07T00:24:13.024353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10441","last_updated":"2024-10-16T09:45:06Z","snapshot_observed_at":"2026-08-04T03:48:44.723741Z","submitted_at":"2024-10-14T12:35:12Z","title":"Free Video-LLM: Prompt-guided Visual Perception for Efficient Training-free Video LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10441","snapshot_observed_at":"2026-08-07T00:23:48.496547Z","title":"Free video-llm: Prompt-guided visual perception for efficient training-free video llms.arXiv preprint arXiv:2410.10441, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:48.496547Z"},"links":{"cited_paper":"/paper/2410.10441","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:4a06785229dc6682223b8eb095d86134fff1d968a859f8d37f155783ffe93b74","observation_id":"25103cae-a729-4d1b-8808-c80a0cd947d2","resolution":{"observed_at":"2026-08-07T00:23:48.496547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T00:23:48.642934Z","title":"Lora: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:48.642934Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:8459ed06a90dead14d2e1fe4975420a9b2528404ee4c106b9c5485a3d6e9c840","observation_id":"63b544d1-ed44-45bb-9e3c-9496c32c5084","resolution":{"observed_at":"2026-08-07T00:23:48.642934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15200","last_updated":"2023-11-16T07:11:02Z","snapshot_observed_at":"2026-08-08T11:16:44.769011Z","submitted_at":"2023-10-23T08:13:33Z","title":"Open-Set Image Tagging with Multi-Grained Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15200","snapshot_observed_at":"2026-08-07T00:23:48.826213Z","title":"Open-set image tagging with multi-grained text supervision.arXiv preprint arXiv:2310.15200, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:48.826213Z"},"links":{"cited_paper":"/paper/2310.15200","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:2db78047581f62892353102bc3bf8a8f10c78b6c7d7cd80f8b3739f89919e9e4","observation_id":"4b671506-9be0-41a9-af65-515c7647b2d9","resolution":{"observed_at":"2026-08-07T00:23:48.826213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04250","last_updated":"2025-03-06T09:33:46Z","snapshot_observed_at":"2026-08-07T17:25:23.186188Z","submitted_at":"2025-03-06T09:33:46Z","title":"An Egocentric Vision-Language Model based Portable Real-time Smart Assistant","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04250","snapshot_observed_at":"2026-08-07T00:23:48.947715Z","title":"An egocentric vision-language model based portable real-time smart assistant","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:48.947715Z"},"links":{"cited_paper":"/paper/2503.04250","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:9c303d89bbdf32382467813137fa68090d5176fd7a6dba9997c84a50b871cdc4","observation_id":"8018aa1f-d80d-4451-9f7c-4181c1fa703e","resolution":{"observed_at":"2026-08-07T00:23:48.947715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.997773Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"4544ed8c-e08a-4986-8872-2b91ef349d3b","year":2021},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:49.046818Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:ce5b70b56b6f14a1692a00a688d361b9a035dee35afd2e32041b733a7f27a64c","observation_id":"f144924f-3394-42d0-9e29-5b38d72109a4","resolution":{"observed_at":"2026-08-07T00:24:13.002916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.03948","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:57.511026Z","title":"Probres: Probabilistic jump diffusion for open-world egocentric activity recognition.arXiv preprint arXiv:2504.03948, 2025","venue":null,"work_id":"79c28e68-a040-4300-a6f9-39e6d651031e","year":2025},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:49.199412Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:755d4dfede22ed5b3f311226a5d8e2ba7dd8e3c71476973452e3c522a56e29fe","observation_id":"4fd599c9-9096-4096-8c84-8e7d39c38f15","resolution":{"observed_at":"2026-08-07T00:23:57.625840Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.976974Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"7696063c-bc0e-4462-b22d-20ddcfa9108b","year":2024},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:49.340948Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:d3a2612e3378b97997b4e6f237bc2a442a064897382df0e8083490c081484f51","observation_id":"e9f67cbd-25d5-418c-93c4-ddfa1492fc0c","resolution":{"observed_at":"2026-08-07T00:24:12.982741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.956846Z","title":"Jrdb-panotrack: An open-world panoptic segmentation and tracking robotic dataset in crowded human environments","venue":null,"work_id":"0bbfcd10-341e-41db-8e1f-0f3d9020b97f","year":2024},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:49.539250Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:f8571815badee63e9e717346449a4c59d197b3f03b631c5e7e6366174bece064","observation_id":"8800bf74-3110-4e41-923c-fc63c89873af","resolution":{"observed_at":"2026-08-07T00:24:12.964929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17207","last_updated":"2025-04-24T02:41:34Z","snapshot_observed_at":"2026-08-07T15:59:40.905046Z","submitted_at":"2025-04-24T02:41:34Z","title":"Perspective-Aware Reasoning in Vision-Language Models via Mental Imagery Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17207","snapshot_observed_at":"2026-08-07T00:23:49.724782Z","title":"Perspective-aware reasoning in vision-language models via mental imagery simulation.arXiv preprint arXiv:2504.17207, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:49.724782Z"},"links":{"cited_paper":"/paper/2504.17207","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:6799f8697f897b3bae043bb8598f1aa9c82caa192f1c4caf0e5c3982ce2e0327","observation_id":"d3871d7f-5c24-4e64-bccb-7f274db91690","resolution":{"observed_at":"2026-08-07T00:23:49.724782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.928153Z","title":"360 vision, from panoramas to vr","venue":null,"work_id":"c0a7769f-5446-4f82-bdd8-bde1f895ea11","year":2017},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:49.888963Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:5a71955c76e100360b1468ca3c6b35d5e3917a541ef7933adf4a6e2880694fc3","observation_id":"d38ba6ba-aff1-4ac1-8f00-f9a7d4ddbd2c","resolution":{"observed_at":"2026-08-07T00:24:12.940982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T00:23:50.042183Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:50.042183Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:3770174180af2401b98856cb6321717cb390ab60c0eecb81d992e4496324af1d","observation_id":"0a17f5af-bee7-4047-b2c9-286bc6d6a855","resolution":{"observed_at":"2026-08-07T00:23:50.042183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.904243Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"439ee334-2774-4fe5-ba63-3f2ed1949217","year":2023},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:50.203825Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:a907ba01bcbd83eeac6cb61e8b75206b02956f8ac4a5dd5d7adceb0503c84fa8","observation_id":"2c2a2053-a2a0-4883-9fcc-c0ee835181d8","resolution":{"observed_at":"2026-08-07T00:24:12.910076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.888500Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"e07c9781-a1f6-4d06-a38d-f978acdfa12c","year":2022},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:50.389090Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:3fcb612401550ea17806fde4a9c0689a8a5ab7bd98f94fccd6da03d7f4500e85","observation_id":"2cf46afd-72a6-45c8-a3f0-4bde58d04b49","resolution":{"observed_at":"2026-08-07T00:24:12.893443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.872188Z","title":"Bevformer: learning bird’s-eye-view representation from lidar-camera via spatiotemporal transformers","venue":null,"work_id":"3e663fb8-3c75-4ddc-ae3e-440e214f8bbb","year":2024},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:50.560653Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:4db077ffe1991152fa4af2af5abbced67e6182b2596a76cf2a9edac4f001e3ea","observation_id":"53a3e681-f990-4774-aa35-e5e36595ec95","resolution":{"observed_at":"2026-08-07T00:24:12.877240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16072","last_updated":"2025-04-22T17:51:41Z","snapshot_observed_at":"2026-08-07T16:00:09.944765Z","submitted_at":"2025-04-22T17:51:41Z","title":"Describe Anything: Detailed Localized Image and Video Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16072","snapshot_observed_at":"2026-08-07T00:23:50.707029Z","title":"Describe anything: Detailed localized image and video captioning.arXiv preprint arXiv:2504.16072, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:50.707029Z"},"links":{"cited_paper":"/paper/2504.16072","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:7c72fbf293852d98e59c9389539f6a352ec3b90b7c9c5414133f3c638f6cb8f3","observation_id":"fcda15fc-7971-4ea6-a4e8-bbf00868cbbc","resolution":{"observed_at":"2026-08-07T00:23:50.707029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.854878Z","title":"Kitti-360: A novel dataset and benchmarks for urban scene understanding in 2d and 3d","venue":null,"work_id":"7ec0a563-4141-4d35-bd95-5f177e43d30a","year":2022},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:50.840787Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:9d09d02d1955280d8cc0f75191da32cfee24dd123a27ed879be95b80108ec40a","observation_id":"33bf2b50-7b2d-4cab-ba1f-85b59c7f2649","resolution":{"observed_at":"2026-08-07T00:24:12.860092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05305","last_updated":"2025-04-07T17:59:44Z","snapshot_observed_at":"2026-08-07T16:07:51.735309Z","submitted_at":"2025-04-07T17:59:44Z","title":"URECA: Unique Region Caption Anything","version":1},"cited_work":{"arxiv_id":"2504.05305","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.05305","snapshot_observed_at":"2026-08-07T00:23:57.040838Z","title":"URECA: Unique Region Caption Anything","venue":"cs.CV","work_id":"3f9e6030-2205-4c63-b629-7dcfb58a5c4b","year":2025},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:50.997640Z"},"links":{"cited_paper":"/paper/2504.05305","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:ed86280090a566f1301a1a8df42ec4a5646eb1d685701296c498e775c3051410","observation_id":"98d2bef8-dc94-43b7-8aa2-912ffb4d41d9","resolution":{"observed_at":"2026-08-07T00:23:57.190251Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.826507Z","title":"Egocentric video-language pretraining","venue":null,"work_id":"88d18b29-8bef-4a8f-bd8c-9a970ae30229","year":null},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:51.288576Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:4ac3560111ea5fb1173988dae96a644747942505cf5466930328bd7ffdc1faec","observation_id":"d7958a0b-fe53-49c7-8d92-40687e2fed69","resolution":{"observed_at":"2026-08-07T00:24:12.835680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-07T00:23:51.692014Z","title":"Improved baselines with visual instruction tuning.arXiv preprint arXiv:2310.03744, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:51.692014Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:1532575804752a03a4d87f9ebe88997d891ef006d3fc975e56e04165797f8bad","observation_id":"dd89bfea-ac48-46be-98d0-e745b4cca1ff","resolution":{"observed_at":"2026-08-07T00:23:51.692014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:51.823118Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:51.823118Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:8e966601a3180937e1355112a31a421c3d3243283a335b288788636e85c4d75f","observation_id":"0cfcb187-889b-4b07-90a5-65fa15f988b6","resolution":{"observed_at":"2026-08-07T00:23:51.823118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-07T00:23:51.969241Z","title":"Visual instruction tuning.arXiv preprint arXiv:2304.08485, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:51.969241Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:44251facb87db8bc106521094c5257054bef7a8d0788bf28d32f4276651da83b","observation_id":"c9583332-e5d8-46d9-89d1-116dbbac691b","resolution":{"observed_at":"2026-08-07T00:23:51.969241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:52.092388Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:52.092388Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:24235dc0fe6d6d1a07f643f7e860a9124e9ad1ec54c624665343fa0ffd1474a0","observation_id":"8a472254-7516-4baa-82ce-39d4cff1595a","resolution":{"observed_at":"2026-08-07T00:23:52.092388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06520","last_updated":"2026-05-31T09:29:40Z","snapshot_observed_at":"2026-08-07T17:19:13.101842Z","submitted_at":"2025-03-09T08:48:51Z","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06520","snapshot_observed_at":"2026-08-07T00:23:52.253339Z","title":"Seg-zero: Reasoning- chain guided segmentation via cognitive reinforcement.arXiv preprint arXiv:2503.06520, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:52.253339Z"},"links":{"cited_paper":"/paper/2503.06520","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:cba460f19bf433df05fa5a423a2a40fe30159ba53422fcf0bd87b6b0cd782a88","observation_id":"e2cc3e1e-8fd0-4759-9e38-edfef6bbb4ff","resolution":{"observed_at":"2026-08-07T00:23:52.253339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.772492Z","title":"Vmamba: Visual state space model","venue":null,"work_id":"4ef7110b-9df8-4bda-90c0-26bb95bbfda0","year":2024},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:52.418148Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:3cb70d5e88e4c005bb9a5699a09b92eabc38fccc0410d0474797582b0553cec7","observation_id":"24d36956-d58a-44a5-909a-76f98353b364","resolution":{"observed_at":"2026-08-07T00:24:12.778073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.747878Z","title":"Mono-internvl: Pushing the boundaries of monolithic multimodal large language models with endogenous visual pre-training","venue":null,"work_id":"fb1ac24a-b55a-436d-bfb0-2abf44f58a87","year":2025},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:52.589839Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:f4d9865476f0fbe3a9ba8849e31a467961a673b276aad9768897f03e2ca8c8e5","observation_id":"ba97da9a-fc7a-4f93-9576-2677d660d8bd","resolution":{"observed_at":"2026-08-07T00:24:12.758898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-07T00:23:52.717672Z","title":"Feast your eyes: Mixture-of-resolution adaptation for multimodal large language models.arXiv preprint arXiv:2403.03003,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:52.717672Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:c95f21a3888c5d48f30b08feb701e4cfcdd05d3bafe9de356ade4e1c963b20ed","observation_id":"4e6d7fd3-13bc-4b76-952b-ad5ea10882ba","resolution":{"observed_at":"2026-08-07T00:23:52.717672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02247","last_updated":"2025-07-19T03:44:28Z","snapshot_observed_at":"2026-08-07T23:57:48.629773Z","submitted_at":"2025-03-04T03:51:36Z","title":"WMNav: Integrating Vision-Language Models into World Models for Object Goal Navigation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02247","snapshot_observed_at":"2026-08-07T00:23:52.841824Z","title":"Wmnav: Integrating vision-language models into world models for object goal navigation.arXiv preprint arXiv:2503.02247, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:52.841824Z"},"links":{"cited_paper":"/paper/2503.02247","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:cf336ea62579dbf9ae72f4e000dbd7fbf57bfe61423a673f29d6e68fa18edc47","observation_id":"15beec1b-391e-4abc-9db7-631f8f3b942e","resolution":{"observed_at":"2026-08-07T00:23:52.841824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.08458","last_updated":"2015-12-02T18:06:03Z","snapshot_observed_at":"2026-07-06T04:37:52.737823Z","submitted_at":"2015-11-26T17:45:01Z","title":"An Introduction to Convolutional Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.08458","snapshot_observed_at":"2026-08-07T00:23:53.035851Z","title":"An introduction to convolutional neural networks.arXiv preprint arXiv:1511.08458, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:53.035851Z"},"links":{"cited_paper":"/paper/1511.08458","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:2e3ee05e89be65796d69867df662cef33b401e1e2d74ccdf121a177eb83c7c6b","observation_id":"30f9e984-28d7-4785-b32b-c9692a9bcee8","resolution":{"observed_at":"2026-08-07T00:23:53.035851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.726540Z","title":"High quality entity segmentation","venue":null,"work_id":"cee228f0-6916-473b-9655-75e53a30fcb7","year":2023},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:53.160707Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:4077463564ab672c5f00a04d3baffc403ba0c50fb91d52799c058df0de4b50a6","observation_id":"47526b45-8e6b-4b24-8631-4108932ab791","resolution":{"observed_at":"2026-08-07T00:24:12.734231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.700381Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"fdb4edd8-5a40-4d6b-8fc3-d155bf81633f","year":2021},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:53.297557Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:713c7e2e72551b6fb9f068fec6a544cd400135900231d18d147b986d9e2222a8","observation_id":"82e57bbf-af03-49af-a59a-576f28a08b57","resolution":{"observed_at":"2026-08-07T00:24:12.710884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-03T16:12:52.104741Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04322","snapshot_observed_at":"2026-08-07T00:23:53.436448Z","title":"Eve: Efficient multimodal vision language models with elastic visual experts.arXiv preprint arXiv:2501.04322, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:53.436448Z"},"links":{"cited_paper":"/paper/2501.04322","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:e29b3e982ec8664f98ccc18e6cef93ffb7a5d75a21f55040a02cb25f7b719c95","observation_id":"16915555-55e8-4406-84dc-2fad6b5f7017","resolution":{"observed_at":"2026-08-07T00:23:53.436448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T00:23:53.585080Z","title":"Sam 2: Segment anything in images and videos.arXiv preprint arXiv:2408.00714, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:53.585080Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:eff7ea358861369338bd185285f7f19708b7f5bebd8805fc47f6b23dfe88ed1b","observation_id":"4a69c100-f78b-4d77-88fc-5206b824bf2c","resolution":{"observed_at":"2026-08-07T00:23:53.585080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T00:23:53.692384Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:53.692384Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:08da44d9b9ad2c790e94eedd3b9a5dacaba91086ffd88890bd04dd91bd07748f","observation_id":"d40654ca-0611-45ba-8c78-d690038f1af3","resolution":{"observed_at":"2026-08-07T00:23:53.692384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.675640Z","title":"Aligning and prompting everything all at once for universal visual perception","venue":null,"work_id":"fb0dd435-c143-4618-a0f9-30c71c35144a","year":2024},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:53.864587Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:43d473052838893378c13916ee20c0f44c5b4138f01ad213e1d9d3119c0a717b","observation_id":"ffd08af7-a2be-4f06-a53c-f2575d90bbf2","resolution":{"observed_at":"2026-08-07T00:24:12.684535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:53.980985Z","title":"Long-vita: Scaling large multi-modal models to 1 million tokens with leading short-context accuray.arXiv preprint arXiv:2502.05177, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:53.980985Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:1d8f9294b4f2bc8a3c42b4d7144281332b4fd9659226d2de811fee77363d8fea","observation_id":"71fbd254-0612-44e7-9186-24547cdd9c54","resolution":{"observed_at":"2026-08-07T00:23:53.980985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.643458Z","title":"Llm-seg: Bridging image segmentation and large language model reasoning","venue":null,"work_id":"7388fc67-9cc2-48fd-9fe5-06f2c204aba4","year":2024},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:54.132655Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:a1a988ec050bed75dc465ef367cefcc004d889b19ef3171da620872dde7044e4","observation_id":"2d39abe6-e400-4315-a46a-5c563ab7bc06","resolution":{"observed_at":"2026-08-07T00:24:12.652859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T00:23:54.265144Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:54.265144Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:8569050701cf8d77b786a7cbaaf18909d6370f0739e6263aa4ea38dfa23534a2","observation_id":"9e378ce9-5d95-4054-8433-31c0a9f585a8","resolution":{"observed_at":"2026-08-07T00:23:54.265144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.615246Z","title":"Controlmllm: Training-free visual prompt learning for multimodal large language models.NeurIPS, 2024","venue":null,"work_id":"030313e8-2b52-4777-a90c-87a36a5502e4","year":2024},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:54.418781Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:a42798f0b096ba8b3840865c383bf020c6fc16cf0136c84ec9ab70da47b987e2","observation_id":"3f8391c1-75ce-496a-a048-0f143d873dc1","resolution":{"observed_at":"2026-08-07T00:24:12.620952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.588777Z","title":"Panovos: Bridging non-panoramic and panoramic views with transformer for video segmentation","venue":null,"work_id":"3be964d5-2943-48f4-b9e7-456392f3fd94","year":2024},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:54.525273Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:2d1b89d61cc6be2eafb04015c4654c517257d525ee697ce3bc7a8379cfd18431","observation_id":"34c78318-8f09-46bd-994b-015e52c18e57","resolution":{"observed_at":"2026-08-07T00:24:12.596862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T00:23:54.624746Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:54.624746Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:3bfc5afbdf159546de4d010b88c12da65a5ff1e40d561ad0d6214c1e4832fe99","observation_id":"8972a759-18e8-4894-99fd-4fe916f4e0db","resolution":{"observed_at":"2026-08-07T00:23:54.624746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-07T00:23:54.745062Z","title":"The dawn of lmms: Preliminary explorations with gpt-4v (ision).arXiv preprint arXiv:2309.17421, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:54.745062Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:af91a5e605f200c449796825ccb90868f5c08362acfb551f57967e2e57c95c9a","observation_id":"df891802-a942-4599-8474-fd00f7d01ca3","resolution":{"observed_at":"2026-08-07T00:23:54.745062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.570333Z","title":"Lavt: Language- aware vision transformer for referring image segmentation","venue":null,"work_id":"c40587a5-40c4-4e8e-a591-92815a6d18eb","year":2022},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:54.863848Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:6ed7498c327686a642468130dba97c3870820d94aa811fce65840d8e2a4903d6","observation_id":"c77a6607-6fb8-4ee6-af3f-6299d34646c1","resolution":{"observed_at":"2026-08-07T00:24:12.577139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-08-08T01:58:42.644918Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04001","snapshot_observed_at":"2026-08-07T00:23:55.038493Z","title":"Sa2va: Marrying sam2 with llava for dense grounded understanding of images and videos.arXiv preprint arXiv:2501.04001, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:55.038493Z"},"links":{"cited_paper":"/paper/2501.04001","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:8a2d6e29e66ab2f37ad8d877ef845c8b6fe86ec80dc6b0e174416b226e5f80ce","observation_id":"c3b87611-1e56-4280-92a5-26ad3a39d9fe","resolution":{"observed_at":"2026-08-07T00:23:55.038493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00476","last_updated":"2025-04-01T07:06:47Z","snapshot_observed_at":"2026-08-07T16:18:24.660756Z","submitted_at":"2025-04-01T07:06:47Z","title":"4th PVUW MeViS 3rd Place Report: Sa2VA","version":1},"cited_work":{"arxiv_id":"2504.00476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.00476","snapshot_observed_at":"2026-08-07T00:23:56.541091Z","title":"4th PVUW MeViS 3rd Place Report: Sa2VA","venue":"cs.CV","work_id":"cb2549cb-a6bf-4c89-a401-47e01ecd34f8","year":2025},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:55.213758Z"},"links":{"cited_paper":"/paper/2504.00476","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:e0761573a88265c25c61f34f273706e0ec0c673c36c5ecee6d026dfdddc73a97","observation_id":"1b3bd26b-2507-4633-8ae5-07bba7d6b1f6","resolution":{"observed_at":"2026-08-07T00:23:56.620076Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.546441Z","title":"A survey of autonomous driving: Common practices and emerging technologies","venue":null,"work_id":"7be7040c-3191-4500-98f8-9e62a6c952fd","year":2020},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:55.307602Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:29ca33d85a1c0017bc5e53ad5418ab634139bad56739053feabc9983b7cf6c37","observation_id":"4ad2ed5a-b432-4577-824e-91ff16561e7e","resolution":{"observed_at":"2026-08-07T00:24:12.556252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.506599Z","title":"Clip2: Contrastive language-image-point pretraining from real-world point cloud data","venue":null,"work_id":"cd95acf4-65d3-4d44-8485-ba8938c8f242","year":2023},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:55.459621Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:1b6a4338c821c1c0ed23d40ce7b4af1bd0c9aaf21212a312e446c007e5bc065d","observation_id":"0fba62ea-e0c4-4e14-ba15-9b393f6d363d","resolution":{"observed_at":"2026-08-07T00:24:12.526171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14254","last_updated":"2025-06-10T21:36:52Z","snapshot_observed_at":"2026-08-07T18:03:02.988777Z","submitted_at":"2025-02-20T04:41:40Z","title":"Mem2Ego: Empowering Vision-Language Models with Global-to-Ego Memory for Long-Horizon Embodied Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14254","snapshot_observed_at":"2026-08-07T00:23:55.610434Z","title":"Mem2ego: Empowering vision-language models with global-to-ego memory for long-horizon embodied navigation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:55.610434Z"},"links":{"cited_paper":"/paper/2502.14254","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:3c7496460ced2a07d8ee601160464de1c973e280341d27d1874f78abbf5007ed","observation_id":"f49336c0-18ca-48ea-bd2c-df8b99664fc8","resolution":{"observed_at":"2026-08-07T00:23:55.610434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.479335Z","title":"Omg-llava: Bridging image-level, object-level, pixel-level reasoning and understanding","venue":null,"work_id":"69ff6fb8-4308-41fd-aab5-80f664cbf6c5","year":2024},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:55.631580Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:14fe96e30406c28b649b2377ed712818138302c69209156bf52cf84ffeaeeb74","observation_id":"4b7c6e32-ed8d-4597-a3cd-3ebc49e99a1d","resolution":{"observed_at":"2026-08-07T00:24:12.489587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10465","last_updated":"2025-04-14T17:52:22Z","snapshot_observed_at":"2026-08-07T16:05:47.627466Z","submitted_at":"2025-04-14T17:52:22Z","title":"Pixel-SAIL: Single Transformer For Pixel-Grounded Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10465","snapshot_observed_at":"2026-08-07T00:23:55.688403Z","title":"Pixel-sail: Single transformer for pixel-grounded understanding.arXiv preprint arXiv:2504.10465, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:55.688403Z"},"links":{"cited_paper":"/paper/2504.10465","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:ceeaa4480354305c8a4890a2a44ffdae891dc5df08b4158ff9879321454a3778","observation_id":"b399ce0c-bec0-4a01-8791-97bb3e3cc2dc","resolution":{"observed_at":"2026-08-07T00:23:55.688403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.447027Z","title":"Dvis: Decoupled video instance segmentation framework","venue":null,"work_id":"6ac332b9-0a7f-49a8-90b8-8ff814205861","year":2023},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:55.752960Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:8b4d3b0d7138b0a9a97027936606684a45013d2f6c3d63196970fd08074a4146","observation_id":"80fe0a69-10a9-445c-9a5b-6d76474da871","resolution":{"observed_at":"2026-08-07T00:24:12.456402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.322409Z","title":"Dvis++: Improved decoupled framework for universal video segmentation","venue":null,"work_id":"ffe87e9a-fb31-4017-be10-ad2885274642","year":2025},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:55.809344Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:953b428f0f328201cd63661467068c4da67a6e00d15cd80e4c6266dd6d8a6c53","observation_id":"4e2f16be-02c8-49e2-b481-e10ad9010d02","resolution":{"observed_at":"2026-08-07T00:24:12.378499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09968","last_updated":"2024-11-15T05:51:29Z","snapshot_observed_at":"2026-08-07T09:15:02.322742Z","submitted_at":"2024-11-15T05:51:29Z","title":"Seeing Clearly by Layer Two: Enhancing Attention Heads to Alleviate Hallucination in LVLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09968","snapshot_observed_at":"2026-08-07T00:23:55.899256Z","title":"Seeing clearly by layer two: Enhancing attention heads to alleviate hallucination in lvlms.arXiv preprint arXiv:2411.09968, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:55.899256Z"},"links":{"cited_paper":"/paper/2411.09968","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:ec49e696c3d78c277df1fb6747c254cb3a1978871069165fc2f8e982d4678947","observation_id":"40febfed-cfd1-45df-b202-9a1c71f8ff8a","resolution":{"observed_at":"2026-08-07T00:23:55.899256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.201063Z","title":"Enhancing multimodal large language models complex reason via similarity computation","venue":null,"work_id":"29fc78dc-2357-49b3-9cc5-919b64648b91","year":2025},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:55.993625Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:6f611a81855156e18185a1e8d8af18ee9c7c3b2160e565a76f1bd2e4260b7cd2","observation_id":"68687a91-09d6-46c1-95ab-02c4b0728478","resolution":{"observed_at":"2026-08-07T00:24:12.255336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.064433Z","title":"Regionclip: Region-based language-image pretraining","venue":null,"work_id":"c700d730-bf96-48b2-9794-29efba009199","year":2022},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:56.064834Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:56b8a9a50c93583a9f0c98b96f1f19ed4ef0cb61bf3cc3ceae0b046274664155","observation_id":"7dcf37e0-b583-4232-8626-40ffb3a89a85","resolution":{"observed_at":"2026-08-07T00:24:12.136861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:10.968063Z","title":"Improving video segmentation via dynamic anchor queries","venue":null,"work_id":"f48c140a-ed7d-4288-a564-36927fac7c67","year":2024},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:56.149763Z"},"links":{"citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:8d95f5ab54a8f041d54f1886c2ad9aa85315b6e99545c895dd613e524124bd97","observation_id":"e8acef3b-10fd-4b4c-82dd-6acd6bf68b49","resolution":{"observed_at":"2026-08-07T00:24:11.979969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04670","last_updated":"2025-07-09T08:04:21Z","snapshot_observed_at":"2026-08-02T10:38:59.539887Z","submitted_at":"2025-01-08T18:30:53Z","title":"Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04670","snapshot_observed_at":"2026-08-07T00:23:56.252708Z","title":"Are they the same? exploring visual correspondence shortcomings of multimodal llms.arXiv preprint arXiv:2501.04670, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:56.252708Z"},"links":{"cited_paper":"/paper/2501.04670","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:d693208a7ea9d6b58d3cef56af708822daaca89af954f471a3c3ff6fb72905f9","observation_id":"cd2f3850-3373-487a-b4ea-3993548ed273","resolution":{"observed_at":"2026-08-07T00:23:56.252708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T00:23:56.322623Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source 14 multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:56.322623Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:6cef384c666fbde744aa1a11d19be03693848ee721959d97bd9b0bd54f52f509","observation_id":"12a90f74-4402-4da3-8371-388257d89423","resolution":{"observed_at":"2026-08-07T00:23:56.322623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":4,"verified_fuzzy":37},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 6 inbound Pith citation observations for arXiv:2506.14471."}