{"as_of":"2026-08-08T08:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:21793ea4541bca72f393197667915f0053b9d4390df692d5123f5025ea6eff3d","coverage":[{"denominator":9,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:15:11.601779Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T10:02:03.266407Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T17:40:00.898211Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-07T21:25:49.140474Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"cited_work":{"arxiv_id":"2602.08711","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.08711","snapshot_observed_at":"2026-07-04T17:40:00.898211Z","title":"Timechat-captioner: Scripting multi-scene videos with time-aware and structural audio-visual captions","venue":"cs.CV","work_id":"4c791cdb-a0f4-46ae-b9b5-e951f3741e21","year":2026},"citing_paper":{"arxiv_id":"2604.11102","last_updated":"2026-04-13T07:19:27Z","snapshot_observed_at":"2026-08-05T04:07:22.236608Z","submitted_at":"2026-04-13T07:19:27Z","title":"OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T15:35:23.842691Z"},"links":{"cited_paper":"/paper/2602.08711","citing_paper":"/paper/2604.11102"},"observation_digest":"sha256:c870068b6df196183d17b4d8c132ee629a5cab39ba7ad38a34331b6a536c0f1e","observation_id":"52056ccb-249e-40b0-a81d-75779896f93b","resolution":{"observed_at":"2026-07-03T02:17:09.422974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-07T21:25:49.140474Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"cited_work":{"arxiv_id":"2602.08711","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.08711","snapshot_observed_at":"2026-07-04T17:40:00.898211Z","title":"Timechat-captioner: Scripting multi-scene videos with time-aware and structural audio-visual captions","venue":"cs.CV","work_id":"4c791cdb-a0f4-46ae-b9b5-e951f3741e21","year":2026},"citing_paper":{"arxiv_id":"2605.04503","last_updated":"2026-05-06T05:12:41Z","snapshot_observed_at":"2026-08-02T14:20:11.154625Z","submitted_at":"2026-05-06T05:12:41Z","title":"DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T17:56:47.621050Z"},"links":{"cited_paper":"/paper/2602.08711","citing_paper":"/paper/2605.04503"},"observation_digest":"sha256:291f1cea350c457939daba0911fb1459dc1042df0cbeaedfdf56dfc7ca54a66a","observation_id":"0a8d3301-f527-4e13-bd04-03d87c9e37d8","resolution":{"observed_at":"2026-07-03T02:17:09.422974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-07T21:25:49.140474Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"cited_work":{"arxiv_id":"2602.08711","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.08711","snapshot_observed_at":"2026-07-04T17:40:00.898211Z","title":"Timechat-captioner: Scripting multi-scene videos with time-aware and structural audio-visual captions","venue":"cs.CV","work_id":"4c791cdb-a0f4-46ae-b9b5-e951f3741e21","year":2026},"citing_paper":{"arxiv_id":"2606.24636","last_updated":"2026-06-23T14:29:40Z","snapshot_observed_at":"2026-08-07T23:34:44.066451Z","submitted_at":"2026-06-23T14:29:40Z","title":"CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-25T23:29:24.520537Z"},"links":{"cited_paper":"/paper/2602.08711","citing_paper":"/paper/2606.24636"},"observation_digest":"sha256:c213b208d5bca0541f1ce9586131ac2a50bde2a06b9a4548795d789b18a5a82d","observation_id":"ae5e7b81-915d-4acf-ac1f-cc23263dbccd","resolution":{"observed_at":"2026-07-04T17:40:00.899555Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-07T21:25:49.140474Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.08711","snapshot_observed_at":"2026-08-01T10:02:03.266407Z","title":"Timechat- captioner: Scripting multi-scene videos with time-aware and structural audio-visual captions.CoRR, abs/2602.08711, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20389","last_updated":"2026-07-22T17:17:33Z","snapshot_observed_at":"2026-08-07T12:38:32.377959Z","submitted_at":"2026-07-22T17:17:33Z","title":"PercepCap: Video Captioner with Structured Spatio-Temporal Perception","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T10:02:03.266407Z"},"links":{"cited_paper":"/paper/2602.08711","citing_paper":"/paper/2607.20389"},"observation_digest":"sha256:7b8c72c42116377c25fc99e4f43e63711bbb8d1c8c434f3e8a0d7d2d9f2a04a5","observation_id":"7deff422-86ba-4f42-a199-15919089ae58","resolution":{"observed_at":"2026-08-01T10:02:03.266407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2602.08711/citation-record","integrity":"/paper/2602.08711/integrity","json":"/paper/2602.08711/citation-record.json","paper":"/paper/2602.08711"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:15:11.405612Z","title":"• Each minute usually contains4–5 segments, but prioritize the video’s logic over strict numbers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-07T21:25:49.140474Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T03:15:11.405612Z"},"links":{"citing_paper":"/paper/2602.08711"},"observation_digest":"sha256:9523d164dd7996e6b10389b6abf3cd5dd20712d80bb438899272306080261fbf","observation_id":"4c776e3f-1171-4350-aae9-9bc360072212","resolution":{"observed_at":"2026-08-03T03:15:11.405612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:15:11.419923Z","title":"• Includecharacters, actions, objects, emotions, and scene detailswhere relevant","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-07T21:25:49.140474Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T03:15:11.419923Z"},"links":{"citing_paper":"/paper/2602.08711"},"observation_digest":"sha256:8dd11894690c78b08eb683fe960fcd843a34c8939eb2f3e619fd741275a39831","observation_id":"c7a12329-78df-4c02-a3f0-2b912ae77545","resolution":{"observed_at":"2026-08-03T03:15:11.419923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:15:11.451377Z","title":"• Timestamp format:minutes:seconds(e.g.,0:00 - 0:11)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-07T21:25:49.140474Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T03:15:11.451377Z"},"links":{"citing_paper":"/paper/2602.08711"},"observation_digest":"sha256:ad2c8224d8922f877d10c45c16e45c5e8c42edf9ca26683169780b1eaef56995","observation_id":"ebf37857-5121-4598-a9ae-5277186fafd9","resolution":{"observed_at":"2026-08-03T03:15:11.451377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:15:11.478148Z","title":"Each GT caption defines the rough boundaries of a segment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-07T21:25:49.140474Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T03:15:11.478148Z"},"links":{"citing_paper":"/paper/2602.08711"},"observation_digest":"sha256:7f142e58d4a25d2e8bb887a3305ecacb84d4061d77e1cf43c97816a89647749b","observation_id":"ed901d18-4d82-40c8-a04b-510d88aaa265","resolution":{"observed_at":"2026-08-03T03:15:11.478148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:15:11.509777Z","title":"Use the video itself toexpand with details: •Characters: actions, gestures, facial expressions, emotions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-07T21:25:49.140474Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T03:15:11.509777Z"},"links":{"citing_paper":"/paper/2602.08711"},"observation_digest":"sha256:6755eab30a4d9217803d089f03d15843a5c5eb5ddb3cab4aebe4aece1e4e4bed","observation_id":"c71922d9-2cfc-4bca-b50e-9b56dc80e979","resolution":{"observed_at":"2026-08-03T03:15:11.509777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:15:11.541291Z","title":"timestamp","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-07T21:25:49.140474Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T03:15:11.541291Z"},"links":{"citing_paper":"/paper/2602.08711"},"observation_digest":"sha256:9cb529db30a284caa1f8b9c656ff072334cffab1b2b1fd6e72d2b02b366454ca","observation_id":"163a77b1-b06a-42c1-9fe1-1480feb004d2","resolution":{"observed_at":"2026-08-03T03:15:11.541291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:15:11.569122Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-07T21:25:49.140474Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T03:15:11.569122Z"},"links":{"citing_paper":"/paper/2602.08711"},"observation_digest":"sha256:b9ed093ac608efa6f9a11194a3ffb89cb536aa98e3b448e411c807d81d320bd2","observation_id":"a576c31c-d18f-463f-b3fd-044dad84c7e8","resolution":{"observed_at":"2026-08-03T03:15:11.569122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:15:11.601779Z","title":"by_dim\": {","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-07T21:25:49.140474Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T03:15:11.601779Z"},"links":{"citing_paper":"/paper/2602.08711"},"observation_digest":"sha256:8b5b5e8ca35c2c90659e8de03edddc572a29992e0d52dfad788f716a8a087682","observation_id":"8bbc8a29-9465-4f13-b4cf-9b98fa517a21","resolution":{"observed_at":"2026-08-03T03:15:11.601779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-06T22:25:23.475002Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-08-03T03:15:11.377213Z","title":"timestamp","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-07T21:25:49.140474Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T03:15:11.377213Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2602.08711"},"observation_digest":"sha256:6bdc7f94cef30eedbdbddbb57107c359f81735d237b002135cfefb04d3b0c625","observation_id":"95218483-f9a3-4ebb-b2e0-62ea836414ee","resolution":{"observed_at":"2026-08-03T03:15:11.377213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T21:25:49.140474Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions"},"reference_resolution":{"displayed":9,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":9},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 9 of 9 outbound references and 4 inbound Pith citation observations for arXiv:2602.08711."}