As pastas onde estão alojados os ficheiros de dados devem incluir um ficheiro README, um documento em formato texto (.txt) ou markdown (.md), com a informação que permita que os conteúdos sejam corretamente identificados de forma rápida e informativa. Este documento deve aparecer no topo da pasta, devendo nomeá-lo, por exemplo, 0_README.
Conteúdo recomendado para um README
• Informações gerais do projeto: nome, objetivos, período de execução, equipa envolvida e contactos principais.
• Estrutura de pastas e ficheiros: diagrama simples ou lista explicando a organização (ex.: 01_RecolhaDados/DadosBrutos/).
• Convenções de nomeação: regras para nomes de ficheiros e pastas, incluindo abreviações e formatos de data.
• Descrição dos dados: origem, métodos de recolha, software utilizado, formatos de ficheiros e eventuais transformações aplicadas.
• Instruções de uso: passos para reproduzir análises, dependências de software e notas sobre qualidade ou limitações dos dados.
• Histórico de alterações: registo de versões importantes e mudanças feitas (data, autor, descrição).
O ficheiro README deve ser usado não só no contexto da organização interna do projeto, mas também deve acompanhar os dados no momento da sua publicação em repositórios. Enquanto documento que acompanha o dataset, o ficheiro README também deve incluir informação sobre:
Dados de contato dos responsáveis pelo dataset.
Licença de uso dos dados.
Contexto e objetivos da investigação.
Fontes utilizadas e validação dos dados.
Outra documentação de apoio útil, quer no momento do processamento e interpretação dos dados, quer no momento da divulgação dos dados, é o dicionário de dados. Este costuma ter um formato tabular ou de folha de cálculo (por exemplo, ficheiro CSV), descreve de forma clara cada variável ou coluna de um conjunto de dados. Pretende:
· Facilitar a compreensão e reutilização dos dados dentro e fora da equipa.
· Reduzir erros na análise, ao clarificar unidades, códigos e categorias.
· Apoiar a documentação para publicação de dados ou submissão em repositórios.
Exemplo:
|
Nome da variável
|
Descrição
|
Tipo
|
Unidades
|
Valores possíveis
|
Notas
|
|
id_participante
|
Identificador anónimo
|
Texto
|
–
|
Código alfanumérico único
|
Gerado automaticamente
|
|
idade
|
Idade à data da inclusão
|
Numérico
|
Anos
|
≥18
|
Arredondado à unidade mais próxima
|
|
sexo
|
Sexo do participante
|
Categorial
|
–
|
1 = Feminino; 2 = Masculino; 9 = ND
|
ND = não declarado
|
|
hba1c
|
Hemoglobina glicada
|
Numérico
|
%
|
4–15
|
Medida em laboratório X
|
Boas práticas para um dicionário de dados
Criar o dicionário em paralelo com a recolha de dados, não no fim.
Atualizar sempre que se adiciona, remove ou transforma variáveis.
Guardar o ficheiro junto dos dados correspondentes.
Usar um formato aberto (por exemplo .csv ou .xlsx bem estruturado, sem formatação decorativa).