{"as_of":"2026-08-08T02:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8bb78067cf17052012468c9ccbf204d9518b2cbe494fca21b9a34abca6904bc3","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:27:19.300329Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:55.216469Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-08-07T14:27:19.300329Z","title":"arXiv preprint arXiv:2407.14500","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:19.300329Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:402832c910e5b86ae8af5b9961d22c5e73c3a0a3e53aabcf43088140f8a91666","observation_id":"59d82159-fd8b-4c8e-b1ef-e006c7f06415","resolution":{"observed_at":"2026-08-07T14:27:19.300329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-08-07T11:29:29.149297Z","title":"Villa: Unifying vision-language segmentation tasks with large multi-modal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:29.149297Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:0719a8c21ecafb3641d9bfe87bcbf17f275662a3a5544d0376c331176581bf54","observation_id":"51c3e5c4-7511-4120-a3b2-65b765c8c9b2","resolution":{"observed_at":"2026-08-07T11:29:29.149297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-08-07T00:34:25.104905Z","title":"ViLLa: Video reasoning segmentation with large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":200,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:25.104905Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:8de669b89422fb9f10d5d8af51c658a0251cf8f742bb13d370bec2a1bf10f89f","observation_id":"ab1af148-e5f5-45e1-86d7-1042694e9af6","resolution":{"observed_at":"2026-08-07T00:34:25.104905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-08-06T17:38:20.326601Z","title":"arXiv preprint arXiv:2407.14500 (2024) 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:20.326601Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:08420de81ba7f8086bf1dde19df11e86c7e4b1d0ffee6389473dc825d5b21a2b","observation_id":"d69fd75a-9aa7-4bd6-928c-b428aaaf0e05","resolution":{"observed_at":"2026-08-06T17:38:20.326601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-08-06T16:43:56.438861Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12883","last_updated":"2025-08-13T05:27:53Z","snapshot_observed_at":"2026-08-06T16:33:30.327495Z","submitted_at":"2025-07-17T08:09:31Z","title":"HRSeg: High-Resolution Visual Perception and Enhancement for Reasoning Segmentation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T16:43:56.438861Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2507.12883"},"observation_digest":"sha256:740171625371b51b1d2dedd91b1c1f2428aaa635dc8f5b973579608a46710626","observation_id":"51c74104-c7d0-4941-bc6f-b74ebc17b510","resolution":{"observed_at":"2026-08-06T16:43:56.438861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-08-06T11:16:10.460552Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.460552Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:31cfb040ba876d4e91e05a12c1f83cc4ebfc33931b6f374af0d5bcc888d5d00a","observation_id":"f35ef5b4-7b2b-4406-9312-0d74b021a834","resolution":{"observed_at":"2026-08-06T11:16:10.460552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-08-05T05:09:31.781108Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05751","last_updated":"2025-09-06T15:46:23Z","snapshot_observed_at":"2026-08-07T17:03:08.682303Z","submitted_at":"2025-09-06T15:46:23Z","title":"Unleashing Hierarchical Reasoning: An LLM-Driven Framework for Training-Free Referring Video Object Segmentation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T05:09:31.781108Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2509.05751"},"observation_digest":"sha256:4042cc83a1f16055e9a6b395853e0cb83c3edeaa4c5145ecab7ab718cb12436b","observation_id":"dd204a70-d312-42b5-b8a4-8b8f3464d726","resolution":{"observed_at":"2026-08-05T05:09:31.781108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":"2407.14500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-07-04T15:09:55.216469Z","title":"Villa: Video reasoning segmentation with large language model","venue":null,"work_id":"ae3f07f5-23ca-4eee-a141-b69a7460ae36","year":2024},"citing_paper":{"arxiv_id":"2604.11789","last_updated":"2026-04-20T14:38:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T17:55:02Z","title":"LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation","version":2},"reference_index":239,"source":"pdf_text","source_observed_at":"2026-05-10T15:35:37.095627Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2604.11789"},"observation_digest":"sha256:446a165afa2720263c4507f36e7b6f1694fd4035a32123a9f1caa48cc380351d","observation_id":"b829bba1-a116-4cf6-a6c0-05e336f5e66c","resolution":{"observed_at":"2026-05-11T10:11:08.070769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":"2407.14500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-07-04T15:09:55.216469Z","title":"Villa: Video reasoning segmentation with large language model","venue":null,"work_id":"ae3f07f5-23ca-4eee-a141-b69a7460ae36","year":2024},"citing_paper":{"arxiv_id":"2604.15670","last_updated":"2026-07-24T04:48:23Z","snapshot_observed_at":"2026-08-02T16:09:56.976755Z","submitted_at":"2026-04-17T03:48:56Z","title":"PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T09:20:54.635375Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2604.15670"},"observation_digest":"sha256:b6cd10e35e7ab452aee321eb6faa359bb84787ef9880bcc39ec3f09ff15eb652","observation_id":"9752265a-1874-4753-a54e-5512d78a2de7","resolution":{"observed_at":"2026-05-10T09:23:37.143330Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-08-02T16:10:02.936737Z","title":"Villa: Video rea- soning segmentation with large language model.CoRR, abs/2407.14500, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.15670","last_updated":"2026-07-24T04:48:23Z","snapshot_observed_at":"2026-08-02T16:09:56.976755Z","submitted_at":"2026-04-17T03:48:56Z","title":"PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T16:10:02.936737Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2604.15670"},"observation_digest":"sha256:5167a39ef55311cd947fa6422b0166655cb8a98ee14ecd2e086f0bc0fdc8de1c","observation_id":"41eec131-2845-444a-84fa-8165ba0eec00","resolution":{"observed_at":"2026-08-02T16:10:02.936737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":"2407.14500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-07-04T15:09:55.216469Z","title":"Villa: Video reasoning segmentation with large language model","venue":null,"work_id":"ae3f07f5-23ca-4eee-a141-b69a7460ae36","year":2024},"citing_paper":{"arxiv_id":"2604.17797","last_updated":"2026-04-21T05:39:06Z","snapshot_observed_at":"2026-08-02T01:31:40.914610Z","submitted_at":"2026-04-20T04:38:45Z","title":"Weakly-Supervised Referring Video Object Segmentation through Text Supervision","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T05:54:33.227975Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2604.17797"},"observation_digest":"sha256:f9be4dadb1b42c1a6b7b9c001df4569ff93785520d8350037f40b197e8a07fcc","observation_id":"24c37d64-4d13-4d55-bf73-140cbe1b3500","resolution":{"observed_at":"2026-05-10T05:56:11.089619Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":"2407.14500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-07-04T15:09:55.216469Z","title":"Villa: Video reasoning segmentation with large language model","venue":null,"work_id":"ae3f07f5-23ca-4eee-a141-b69a7460ae36","year":2024},"citing_paper":{"arxiv_id":"2604.18665","last_updated":"2026-04-20T14:40:43Z","snapshot_observed_at":"2026-07-06T23:05:30.879164Z","submitted_at":"2026-04-20T14:40:43Z","title":"APRVOS: 1st Place Winner of 5th PVUW MeViS-Audio Track","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T03:29:12.783993Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2604.18665"},"observation_digest":"sha256:e142a33f484d4b83e87132a3f958ea1efd650095ca672f33c9a7910f8e0a36f9","observation_id":"88f36ba8-30bd-4fa6-9265-6d15d5212724","resolution":{"observed_at":"2026-05-10T03:29:21.565364Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":"2407.14500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-07-04T15:09:55.216469Z","title":"Villa: Video reasoning segmentation with large language model","venue":null,"work_id":"ae3f07f5-23ca-4eee-a141-b69a7460ae36","year":2024},"citing_paper":{"arxiv_id":"2604.22836","last_updated":"2026-04-20T14:36:19Z","snapshot_observed_at":"2026-07-06T23:09:10.050398Z","submitted_at":"2026-04-20T14:36:19Z","title":"AgentRVOS for MeViS-Text Track of 5th PVUW Challenge: 3rd Method","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T05:14:25.423302Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2604.22836"},"observation_digest":"sha256:b841cde55d1597cb918d44af5652994cbbcfc391e0132e58c8684379340241bf","observation_id":"3b99a5eb-097e-40f2-838c-751e1f2a28ae","resolution":{"observed_at":"2026-05-10T09:33:41.857762Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":"2407.14500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-07-04T15:09:55.216469Z","title":"Villa: Video reasoning segmentation with large language model","venue":null,"work_id":"ae3f07f5-23ca-4eee-a141-b69a7460ae36","year":2024},"citing_paper":{"arxiv_id":"2605.07334","last_updated":"2026-05-08T06:39:53Z","snapshot_observed_at":"2026-07-30T14:06:30.177866Z","submitted_at":"2026-05-08T06:39:53Z","title":"RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T01:16:25.031349Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2605.07334"},"observation_digest":"sha256:d5b3ed54d2f036872e57e7671b563422c8a25ee988aa489b6d7effc44e1ce19a","observation_id":"6e2118be-67cd-429d-b53a-d9e35271a891","resolution":{"observed_at":"2026-05-11T04:30:59.882045Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":"2407.14500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-07-04T15:09:55.216469Z","title":"Villa: Video reasoning segmentation with large language model","venue":null,"work_id":"ae3f07f5-23ca-4eee-a141-b69a7460ae36","year":2024},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:f8a205501440610ad46f56244fe1d2b57eb36405c39b8c4b486f4813a5ac5d35","observation_id":"7c45d39c-2791-40cc-8f92-915504edf8e5","resolution":{"observed_at":"2026-07-04T15:09:55.217966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2407.14500/citation-record","integrity":"/paper/2407.14500/integrity","json":"/paper/2407.14500/citation-record.json","paper":"/paper/2407.14500"},"outbound":[],"paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2407.14500."}