{"as_of":"2026-08-14T01:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:99375ca725e8d8e87dc89e1be123d02a69749cf4a0c72a0198ca10c3d49bea39","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T00:15:26.685663Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.03744/citation-record","integrity":"/paper/2607.03744/integrity","json":"/paper/2607.03744/citation-record.json","paper":"/paper/2607.03744"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"Depression and other common mental disorders: Global health estimates,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:8c2dde9c981d47729961c6a9919d52bc0bc0e2f57b5d5fc000ba2a5669fa4173","observation_id":"b49a4297-6a62-4c34-9000-a403372702a6","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"A VEC 2013: The continuous audio/visual emotion and depression recognition challenge,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:36588f3e3ff07fbea2fdeb9928bf14995951e0229e65711f69bfffc6779d04a8","observation_id":"8ba672af-c612-48d4-9b6b-7577b6475eb7","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"A VEC 2016: Depression, mood, and emotion recognition workshop and chal- lenge,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:c91fc84ca135c93ca4b422fcf329a1095164e8926019f8097afb9f693c6d1ccf","observation_id":"f6ecac02-cea2-4d0b-ab54-844a8203b17d","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"WavLM: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:1b47b47403fe4ca6007daff5eca67714bb37ea3f74e34c92510cf113f427e629","observation_id":"4a91d901-ec48-49ae-b4ab-2cec703260a6","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"RoBERTa: A robustly optimized BERT pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:2632db1a7e70efad2fdbd0b1b57733078691e04df954368326b41e11ce364323","observation_id":"271d7880-5895-4818-894e-7b5689ccd3ca","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"Using speech recognition technology to investigate the association between timing- related speech features and depression severity,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:3e7bd86b94f35a20e8b378ba336026d853944b844fe1448091ec3a31758345bc","observation_id":"2f2107e4-82a8-4531-9bbc-190acb98b0ea","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"V ocal acoustic biomarkers of depression severity and treatment response,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:96ebf4669d85426e4e7f9f3dcaea41ad8bb6b2fcd680c3e8fe323d4ed0e66788","observation_id":"428b58ba-d228-4bd9-9437-aa5703845298","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"A review of depression and suicide risk assessment using speech analysis,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:1b4cbe98e1ed5c482850dcdda9d5380f596f645a1919bba86e01e79702e4cd1e","observation_id":"2d0c016d-e150-4bc3-9eb1-9f81ebab6b9b","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"Identifying mood episodes using dialogue features from clinical interviews,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:afc96b11a3fc67f27bf405e2bdee821d2535abe87af3c4165fe110033a717914","observation_id":"d8714fe7-9156-40dd-8c21-1f2915af9b70","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"Beyond short-frame acoustic features: Capturing long-term speech patterns for depression detection,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:89a54107b250450142e77b08ee8c0372243e161d24caceea7f8ec8d7bac5edaf","observation_id":"d5737d20-e946-489e-a012-798c210c20cd","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"Natural language processing methods for acoustic and landmark event-based features in speech-based depression detection,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:824c642dbf9e3a695cf7d75a56f33ccbf9d108c5799ffa247138fa2448bc9fa9","observation_id":"799f601b-ec3f-44c2-894d-7c03a2e9c02e","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"When LLMs meets acoustic landmarks: An efficient approach to integrate speech into large language models for depression detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:30aeb8c83ab548b6c2c178e50da279d1c6850eec7137b986a0012e9d7d2111fd","observation_id":"1c9b788f-ca3b-464c-a3e3-c24dd5d60b33","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"Joint learning of conversational temporal dynamics and acoustic features for speech deception detection in dialog games,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:c1749516a524f857a55908916811339b1433cf9ea46fdb9bd6b8e8b1d1fbbdd0","observation_id":"3123cd1f-a937-4e75-961d-b0c537764271","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"Automatic deception detec- tion using multiple speech and language communicative descriptors in dialogs,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:b3269995fc2ad0d8f7bf40c374a790d4124964aa2af2a27a75db17d4463840bc","observation_id":"04fc7b94-fef0-4d44-bed6-c1dbdc851b5e","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10950","last_updated":"2025-05-23T05:22:25Z","snapshot_observed_at":"2026-08-10T01:01:57.839500Z","submitted_at":"2025-02-16T02:02:19Z","title":"SpeechT-RAG: Reliable Depression Detection in LLMs with Retrieval-Augmented Generation Using Speech Timing Information","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10950","snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"SpeechT-RAG: Reliable depression detection in LLMs with retrieval-augmented genera- tion using speech timing information,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"cited_paper":"/paper/2502.10950","citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:9c0a4663232667c930e86f95a0c20fb2dfc64df2e4077dc4cd7e50e63ca6e417","observation_id":"c51d7163-f1a1-4b76-8b64-70a70d5378b9","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"The distress analysis interview corpus of human and computer interviews,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:7f3ae3bf692668b2f3dc598eddc986e0ec154c7d4a4db201798a51875466ebf4","observation_id":"a1e39b70-50fa-4ccd-ab27-c1b5cfac66b5","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"Detecting depression with audio/text sequence modeling of interviews,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:ef495e69ecbb8ba7695fc0ab4e78f34076f0344d8160a54a015423d176d26070","observation_id":"90f420d2-06d6-4be6-88f8-93670482550d","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:2b43713ac4fa823aceb20a0c89c8d4f5a24f2503f206cafc1c4a7e2930b8a93f","observation_id":"7f9d317a-570f-4b6a-8f92-9f6390162062","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"SUPERB: Speech processing universal PERformance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:97039d9ddf1be4b64fc9053bba9c1e062e26f89492997786f3c5c302333f58ba","observation_id":"1edd64ee-7fc0-4563-b534-deaca4a552e2","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"Topic modeling based multi-modal depression detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:42324d1882829cce48ae051824464429f3dc1c9486009f039986bcb60980038c","observation_id":"b7ea9bf5-b56d-444a-b0d0-146a834db87d","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"Automatic depression detection: An emotional audio-textual corpus and a GRU/BiLSTM-based model,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:a9e5a2718d124612e91111bd6cf26d50673630e01f00f411a4f1681ec0404bc2","observation_id":"cc05bffb-9776-4af4-a30a-f059fcb55d51","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"Self-supervised representations in speech-based depression detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:7f4088c81dd7fd6ed2d09987371b5d80fcbf3882db915cf65a4d32222a07c5b3","observation_id":"a2252212-af93-47ba-8927-4b0a6702c70d","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"Hierarchical self-supervised repre- sentation learning for depression detection from speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:6959d8e3b3f737ecf44dc19db41b206e0d5c31b0eba165113d0838614167a847","observation_id":"c15ca2f6-f107-428f-9e7b-563df2cc917f","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"Test-time training for speech-based depression detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:023e646a324cd22621c0e76621f5281db70205ecf685bc421975902c597295cb","observation_id":"9b3ec7a6-6608-4a69-bec5-1beeaab0c52c","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03359","last_updated":"2025-05-06T09:29:14Z","snapshot_observed_at":"2026-08-07T15:49:37.799858Z","submitted_at":"2025-05-06T09:29:14Z","title":"Domain Adversarial Training for Mitigating Gender Bias in Speech-based Mental Health Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03359","snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"Domain adversarial training for mitigating gender bias in speech-based mental health detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"cited_paper":"/paper/2505.03359","citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:6cb86bcc68f15ec54eaaff459f90105d03b604aaa392a665afe6016cac102c4b","observation_id":"b0c2a76f-9045-4353-bd88-c914ef637211","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"The PHQ-8 as a measure of current depression in the general population,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:d95b191f5ad6e9d008b73a1f43e16085c39531a2dfc9c537931a4cafb7ca3652","observation_id":"08521fb0-6c5a-4cdd-8bbf-028aaa28337b","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"Common pitfalls and recommendations for use of machine learning in depression severity estimation: DAIC-WOZ study,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:89d9609bd8ead3be0140b9828911a1c0e9e33a61c3a7f4ea2424665253c4e366","observation_id":"58963bc1-bb21-4273-8ce2-566bbb4374e1","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19340","last_updated":"2024-10-11T18:52:25Z","snapshot_observed_at":"2026-08-13T10:17:28.786823Z","submitted_at":"2024-07-27T21:00:36Z","title":"Integrating Large Language Models into a Tri-Modal Architecture for Automated Depression Classification on the DAIC-WOZ","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19340","snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"Integrating large language models into a tri-modal architecture for automated depression classification on the DAIC-WOZ,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"cited_paper":"/paper/2407.19340","citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:356e3d18a786426de274da93453c53117762058c573e4dd6f92b70c3e9a6a860","observation_id":"fa9f27cb-1e76-409d-871d-6718714436b7","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"DAIC-WOZ: On the validity of using the therapist’s prompts in automatic depression detection from clinical interviews,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:5e4caaa1c870300b60c6f0a9664dc9672bcb6d4e7621af1c4e4f876273cdbe6a","observation_id":"273b79c2-80a9-4b87-acf6-e4ecb0b63ddd","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"The geneva minimalistic acoustic parameter set (eGeMAPS) for voice research and affective computing,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:d604c0e2e19f1ca725560abfd4f44f30d7d1bb82a7976bf70ebf95e5abd2dfc4","observation_id":"e62d01b3-7de5-45bd-adb0-608a699b742c","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:15:26.685663Z","title":"Confidence intervals for evaluation in ma- chine learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T00:15:26.685663Z"},"links":{"citing_paper":"/paper/2607.03744"},"observation_digest":"sha256:e092ea944df7ee689fcb3f1c92859250f7f918127252be8dfc93687680c340ec","observation_id":"02713e80-67c5-48e9-b60f-a28353a86b6e","resolution":{"observed_at":"2026-07-12T00:15:26.685663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.03744","last_updated":"2026-07-04T07:33:22Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-13T04:50:15.302951Z","submitted_at":"2026-07-04T07:33:22Z","title":"Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2607.03744."}