{"as_of":"2026-08-09T07:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e5bdc3058a6df87e4d4cbcdd9d0824eb4727b3196e5d801c687872725be92ba6","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T19:01:53.106123Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.13584/citation-record","integrity":"/paper/2508.13584/integrity","json":"/paper/2508.13584/citation-record.json","paper":"/paper/2508.13584"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.23287","last_updated":"2025-08-06T18:46:52Z","snapshot_observed_at":"2026-08-08T06:41:24.011482Z","submitted_at":"2024-10-30T17:59:26Z","title":"ReferEverything: Towards Segmenting Everything We Can Speak of in Videos","version":2},"cited_work":{"arxiv_id":"2410.23287","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.23287","snapshot_observed_at":"2026-08-05T19:01:53.188856Z","title":"ReferEverything: Towards Segmenting Everything We Can Speak of in Videos","venue":"cs.CV","work_id":"ed95ff82-7951-44c1-81b2-e525bde29d14","year":2024},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:52.990247Z"},"links":{"cited_paper":"/paper/2410.23287","citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:d1b9de6f308f4e2555c96776027b995bae0213113bb7204e8cf379a21c3164b4","observation_id":"9a691b2e-9d1f-4f10-ab6f-ead90a2cb0b2","resolution":{"observed_at":"2026-08-05T19:01:53.192091Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.496235Z","title":null,"venue":null,"work_id":"d8c28126-3ba2-49f2-9251-35276ce3a703","year":2022},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:52.993660Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:ccd3bc8ed669726ecbf0a4ff13986258570317baeaf730b3165decc8db146626","observation_id":"8b7b840e-1440-4b83-8c0b-99a751334be5","resolution":{"observed_at":"2026-08-05T19:01:53.499269Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.486514Z","title":null,"venue":null,"work_id":"8c0e1332-2107-40c1-8c47-22bf4ff83bae","year":2020},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:52.996511Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:75ab91f3f381561051d4be3e1cafa629322514bb727f7ef1654f1405ba01662b","observation_id":"ed739f0d-1e40-4524-b12e-9cbf33aa7e55","resolution":{"observed_at":"2026-08-05T19:01:53.489233Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.477213Z","title":null,"venue":null,"work_id":"85d3a9c3-cc1c-41fc-86cc-7aac0276968f","year":2024},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:52.999569Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:03d6d5a12cfdc0a3afa7d7bae568e32f86f0bcdab7bd33652ebf89efeeeb0180","observation_id":"a915e806-c6f0-43f6-b001-7cd90c77a547","resolution":{"observed_at":"2026-08-05T19:01:53.480154Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.466915Z","title":null,"venue":null,"work_id":"4352e933-dd40-4206-8988-dbf9f9a0f2e5","year":2022},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.002966Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:13a7a44c88e58eff9bb5d309a8dbbdb4bde1d28ced5890c25df22c6fb358fac5","observation_id":"e502e853-745a-4ef5-935a-45e2919cc45a","resolution":{"observed_at":"2026-08-05T19:01:53.469659Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.456614Z","title":"K.; Oh, S","venue":null,"work_id":"c64a5319-5829-4951-af0e-f4db8f9ea40a","year":2024},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.005727Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:fdd0140d6476dd60fa3b8a45cec051ddfd5407cde2eeb4a8e8dbd725848c7485","observation_id":"4bf18847-d412-4528-b2f6-5d7dc9a8c718","resolution":{"observed_at":"2026-08-05T19:01:53.459383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.447439Z","title":"K.; Oh, S","venue":null,"work_id":"31219e3a-a8ff-441e-b83d-924d45be3341","year":2023},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.008741Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:1963a191f945825c4366c69077bd74cade60e23180c001f9d816dca94eead03e","observation_id":"2cf6b79d-316b-4dbb-915d-812593d317b4","resolution":{"observed_at":"2026-08-05T19:01:53.450211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.437931Z","title":"K.; and Schwing, A","venue":null,"work_id":"6e475ae4-e8ba-4ead-ad29-fa2c0562a7f9","year":2022},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.011661Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:e3c1f8c0824d6747bfb809b57a6dce1637804ca07163970c6a07f02823100b97","observation_id":"9c01a500-3aad-4032-98b7-0365367e682c","resolution":{"observed_at":"2026-08-05T19:01:53.441078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.427264Z","title":null,"venue":null,"work_id":"36625cd9-da3c-4f80-8d48-e24ee6d4369a","year":2025},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.014295Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:e301de830b814cb50a952ffa910b91d708e11a1774f12ac7b7681c5af42ee436","observation_id":"993cab63-c7ed-4bff-a401-0d57f244af3a","resolution":{"observed_at":"2026-08-05T19:01:53.430096Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.017317Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.017317Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:ada386679d9c9b9599a09cefccde9f117e8542c6fb80efde363d9fffbd3b6cb7","observation_id":"e85b8808-35d4-4d6c-b11f-529c45086123","resolution":{"observed_at":"2026-08-05T19:01:53.017317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.410007Z","title":null,"venue":null,"work_id":"abdca99b-aa8a-4f69-a3d8-8993def6271e","year":2025},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.020577Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:8b872e009afaf62c1bfc08897128dfbd9718cd9e5b89260ac80b0fbdea808022","observation_id":"07c9160e-e9ae-4fc8-959a-c347a6174d5b","resolution":{"observed_at":"2026-08-05T19:01:53.412681Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.400128Z","title":null,"venue":null,"work_id":"3d6ab1b8-8dbb-452f-8b94-612fb5108c58","year":2018},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.023365Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:54d2d02fc798a19ec771f7dabc7e93b05eba84662c49709e487a837f41be60b8","observation_id":"e3d97917-3c64-4198-8c2a-cbb966e07977","resolution":{"observed_at":"2026-08-05T19:01:53.402808Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.390728Z","title":null,"venue":null,"work_id":"9c6f246a-9c45-47e5-86e7-1dbbe2b89306","year":2024},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.025869Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:715da5b3078cb2caeb34c6175fe5fa8aa7fc6b2f64f38db1f39785ba8a04ae16","observation_id":"c637e1b4-d534-410a-a5be-cc6e6e47a36d","resolution":{"observed_at":"2026-08-05T19:01:53.393761Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.028608Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.028608Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:1cdfd43490080ff9a81af22268c2f96f4a498afc6862c4328fc9adea57729179","observation_id":"a8b872f2-f46d-48eb-ae38-85db8befe29f","resolution":{"observed_at":"2026-08-05T19:01:53.028608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.374687Z","title":null,"venue":null,"work_id":"b60d15cc-97ce-41d8-b69d-d75e25e1ed10","year":2018},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.032037Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:90f9e6db4b26efbe17b559e253a7fb89d4be3cbda9cc795b5fdbf315e1f83e55","observation_id":"577b2163-abb8-429e-bcb4-ca11da2973db","resolution":{"observed_at":"2026-08-05T19:01:53.378054Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02855","last_updated":"2026-07-29T07:55:45Z","snapshot_observed_at":"2026-08-01T23:09:00.410365Z","submitted_at":"2019-11-07T11:14:05Z","title":"Dice Loss for Data-imbalanced NLP Tasks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02855","snapshot_observed_at":"2026-08-05T19:01:53.034601Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.034601Z"},"links":{"cited_paper":"/paper/1911.02855","citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:f7b94db8e5f076c825afdc7702b3fbf2c508f1ba0597b88703347ace9f1c8424","observation_id":"da649e16-38d3-4ac8-9dea-ba29c5f8d1a3","resolution":{"observed_at":"2026-08-05T19:01:53.034601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14607","last_updated":"2025-06-30T16:09:19Z","snapshot_observed_at":"2026-07-06T20:25:40.715105Z","submitted_at":"2025-01-24T16:24:15Z","title":"ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations","version":2},"cited_work":{"arxiv_id":"2501.14607","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.14607","snapshot_observed_at":"2026-08-05T19:01:53.161374Z","title":"ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations","venue":"cs.CV","work_id":"34987a8e-b2cc-406a-a771-1c0e665a2b6d","year":2025},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.037954Z"},"links":{"cited_paper":"/paper/2501.14607","citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:088f22f1749e6be8eb3b83f711c9384940849f5a31cf67c24c42e46635818fe3","observation_id":"ac71e21a-a829-46aa-ba28-b147d0845531","resolution":{"observed_at":"2026-08-05T19:01:53.166093Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.041564Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.041564Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:9f732f8a81db2d822086bf8c60ef86e2ee8c86e851c6ea941942d0915e34e417","observation_id":"4d833cd6-8226-427d-b223-723f5cd9b0f6","resolution":{"observed_at":"2026-08-05T19:01:53.041564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.357647Z","title":null,"venue":null,"work_id":"f141b390-fad9-4504-803d-ed4ded2bbb4d","year":2024},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.044107Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:084ad60a42e898a0435d5cde95d779db4b6f06f753e3f08d46eccd58ab90848c","observation_id":"8baa30ad-7e09-477b-983a-e3b06d673eb6","resolution":{"observed_at":"2026-08-05T19:01:53.361009Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.348732Z","title":null,"venue":null,"work_id":"765d66d0-35d8-4618-b979-d439f4c5491b","year":2022},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.047365Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:a50ad6840bc766d0e1ad04fac704183b95f950658f6a7c607acf10e32f8fa590","observation_id":"3c45327a-db21-445f-bde4-d3ab59e51cab","resolution":{"observed_at":"2026-08-05T19:01:53.351525Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.337930Z","title":null,"venue":null,"work_id":"b2958634-b8bd-4302-87f1-10235f85b597","year":2022},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.050313Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:67a8f9a5ac453480c95577e634fbbf36bae15d151cce27a7879ca0ddf730558a","observation_id":"b316c698-547d-467b-af37-bbac52dcccbc","resolution":{"observed_at":"2026-08-05T19:01:53.341390Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.327906Z","title":null,"venue":null,"work_id":"d8d1ea6e-286a-45fe-9ed8-cb300d30401b","year":2023},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.053301Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:991ac9ddc0bfd28745013f0b3b8e55dc2fcf8a1e86ebf9077e3f0ca73a324e31","observation_id":"9e8c7315-0f81-48ca-9f74-11faa9481823","resolution":{"observed_at":"2026-08-05T19:01:53.330867Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.317400Z","title":null,"venue":null,"work_id":"99421ac2-c3f4-462c-920e-b95783792c86","year":2025},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.055859Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:379495adcbe0136d57e9a66715c7703ea69b72146a6c3efa055269dd65e3db77","observation_id":"cfe50cc1-f8e6-46d8-891f-9334f9fb7b86","resolution":{"observed_at":"2026-08-05T19:01:53.321053Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.058566Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.058566Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:b1b59b9da7fbdb15e0508274fd8b62c7b38eaa3a21f93113eb53533255be2a4b","observation_id":"4a672c8f-88f6-4997-a7a0-e7960cd41f9b","resolution":{"observed_at":"2026-08-05T19:01:53.058566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.061953Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.061953Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:00497eecfa8c21b78854e57fe4e20546850965bbe2166a77ed90cdc7ffc3d9a3","observation_id":"db5e2284-172f-4c94-97f7-d4f5ca267b5f","resolution":{"observed_at":"2026-08-05T19:01:53.061953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T19:01:53.065271Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.065271Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:b27ee3d5896e633dcf8157c85f0dfc6a373b6efabaedd24aff2c7552f4389ee1","observation_id":"252c56c1-fea2-4a4e-8e34-61fef5ccdb4c","resolution":{"observed_at":"2026-08-05T19:01:53.065271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.293601Z","title":null,"venue":null,"work_id":"1c1441d3-84fa-4714-a310-6d3f048f33a4","year":2019},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.068420Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:c77228144f4dd4d91d892c83226584969e5ed9c495cdff2ff045dc482146c594","observation_id":"32cc30a3-0ede-441e-8a09-ad067e69df80","resolution":{"observed_at":"2026-08-05T19:01:53.296617Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.071610Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.071610Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:1e7473a4094a6ec3353e9d9bfa1139e1f0dfea7d5d1b772554578a54c072f41a","observation_id":"d4139125-1060-49cc-a9fd-ff805c5c9c16","resolution":{"observed_at":"2026-08-05T19:01:53.071610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.278054Z","title":null,"venue":null,"work_id":"bc5f2fd8-a3b6-4556-b602-57bc943274cf","year":2020},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.074261Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:ef2fb3735d8c931c4762df8c3da70e9c1b1d9f420875da484f3a67a04f1e7819","observation_id":"0efce009-3ecc-4b22-9a0e-90492e5676e9","resolution":{"observed_at":"2026-08-05T19:01:53.280654Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.268454Z","title":null,"venue":null,"work_id":"fcb4d40b-075b-4afb-ac33-b0156ba20129","year":2020},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.076849Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:00746e91402e84b127f46f6486dc266fa8e17f09718ba9e42dcfd73c446dbe5e","observation_id":"80005537-d6dc-4fce-89bc-9fdbfb9d5a7f","resolution":{"observed_at":"2026-08-05T19:01:53.271965Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.257050Z","title":null,"venue":null,"work_id":"9dd7d056-3018-4cac-98a5-cfe73d4a6b23","year":2020},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.079656Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:21282d87c7c838ac935f1ad1b839940f88a4bcec4cd2e6a8652d36eeee3ee5fc","observation_id":"db20a7f5-a704-443b-842c-9e41706a227b","resolution":{"observed_at":"2026-08-05T19:01:53.261020Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-07T17:54:54.749604Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-05T19:01:53.082222Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.082222Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:7996b0de691b916c6b86af2f918c6a136d14d846df1fcbd7e4b7799ea60a1f5e","observation_id":"fad0d6ca-ed0c-483a-bd2a-b89bca69d427","resolution":{"observed_at":"2026-08-05T19:01:53.082222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.247137Z","title":null,"venue":null,"work_id":"1e467423-e734-4460-b474-9937d80b1dc8","year":2022},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.084899Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:55e9b94432b37a05dd80ce0175a202d5d15cce94414fa94fb872b419be7099d2","observation_id":"6f4d31ba-ab0f-4b52-8c2a-f953616ddd3e","resolution":{"observed_at":"2026-08-05T19:01:53.250111Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.238375Z","title":null,"venue":null,"work_id":"be51da85-585d-49c5-bfc5-b55dd1190180","year":2022},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.087946Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:f154c7f1cb03daa89967a71711f8c850e7dd896e8930c2fa705bbec5a0412a76","observation_id":"bc760617-48c9-45b9-b195-6549ca7dbb20","resolution":{"observed_at":"2026-08-05T19:01:53.241066Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.229173Z","title":null,"venue":null,"work_id":"b5a6b9ca-0dc4-47bb-a52e-5c9b92049544","year":2019},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.090811Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:1d92c1bd33eeafaf98a663b2f1268bfdf30387fe2b036068da262858eacc3798","observation_id":"f39d9d45-905c-4d1f-b991-fe04d18adb8c","resolution":{"observed_at":"2026-08-05T19:01:53.232114Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.220465Z","title":null,"venue":null,"work_id":"cfd94330-c381-4fc7-b2db-9f1a6a582ef1","year":2024},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.093500Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:ced6ffa40721b952d6e30fc7d200e8841dc2555b01d8e887288bc7f265b63e8f","observation_id":"7b6bcc9d-17a6-4888-ac66-98a42a9a0cc0","resolution":{"observed_at":"2026-08-05T19:01:53.223140Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-07-06T10:02:45.105181Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04159","snapshot_observed_at":"2026-08-05T19:01:53.096246Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.096246Z"},"links":{"cited_paper":"/paper/2010.04159","citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:9d48e9d0a76c6d3b000ed08395d2e8fad1fd39a2272770b7fe12539c5d5f0b51","observation_id":"9e19be52-d4d0-4f50-a436-b67507acc9de","resolution":{"observed_at":"2026-08-05T19:01:53.096246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.210788Z","title":null,"venue":null,"work_id":"19062842-ecba-43d5-ae84-9a3d523b8650","year":2024},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.099961Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:05752d71828f3142324e23a8b47e108aba1b914620cd07dac16c501bbda4b60a","observation_id":"7879a2ba-cf33-435b-bc4f-eb7493c5371e","resolution":{"observed_at":"2026-08-05T19:01:53.213564Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.103208Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.103208Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:85f15c40b559852648c4e5f172c7f30e241ae581050859881936de7099454b14","observation_id":"99b71d1d-fe44-471d-8c4e-24a2a5858ad0","resolution":{"observed_at":"2026-08-05T19:01:53.103208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:01:53.106123Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T19:01:53.106123Z"},"links":{"citing_paper":"/paper/2508.13584"},"observation_digest":"sha256:72f6c58676b83dcb5ecc2d70456d90c0145160955116435cbea061f800c77bef","observation_id":"1bcc11bd-fbe8-4bc5-a950-91483623fa3c","resolution":{"observed_at":"2026-08-05T19:01:53.106123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.13584","last_updated":"2025-08-19T07:36:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T19:01:41.734511Z","submitted_at":"2025-08-19T07:36:04Z","title":"Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":2,"verified_fuzzy":3},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2508.13584."}