정보 구조: 엉뚱 한 데이터 를 읽을 수 있게 하는 방법을 배웠습니다

데이터 사이언티스트가 "구조되지 않은 것"이 개인적인 모욕이라고 판단하면 어떻게 될까요?

· Nada Boulares

얼마 전 제 시스템은 붕괴점을 맞았습니다.

사고가 아니었어요. 신뢰 문제가였어요. 클라이언트 데이터 세트가 흡수되는 것을 봤습니다. 깨끗한 구조 대신, 시스템은 복제된 복제물을 만들었죠. 같은 조직은 지식 그래프에 3 번 나타났습니다. 왜냐하면 소스 데이터는 세 가지 다른 이름의 컨벤션을 사용했기 때문입니다. McKinsey & Company, McKinsey & Company,Mckinsey. 인간에게, 그것은 분명히 하나의 존재입니다. 그래프에 있어서, 그것은 3개의 분리된 노드이고, 3개의 분리된 관계들이 있습니다. 같은 진실을 병행한 세 가지 버전

그 순간 저는 데이터를 단순히 저장하는 것으로 생각하지 않고, 아키텍트라는 것으로 생각하기 시작했습니다.

** 모든 것이 계획보다 더 크다**

이것은 인간이 생성한 데이터를 처리하는 시스템을 만들 때 아무도 준비하지 않는 것입니다. 인간은 매우 불합동적입니다. 그리고 저는 매력적인 의미에서 말하는 것이 아니라, 여러분의 스케마에서 만들어지는 모든 가정들을 깨는 방식으로 말하는 것입니다.

한 사람은 Python를 쓰고, 다른 사람은 Python 프로그래밍 언어를 쓰고, 세 사람은 python를 작문으로 쓰고, 순수적인 문자열 비교에 따르면, 이것들은 완전히 다른 4개의 존재입니다. 네 개의 노드 네 가지 거짓말이 그래프에 있습니다.

저는 이 문제를 해결하기 위해 고안된 것이 아니라 깨끗한 데이터 파이프라인을 만들고 싶었습니다. 하지만 파이프라인에서 인간 데이터를 섭취하면 이 엉망이 문제입니다. 다른 모든 것은 하류입니다.

비주얼 지하라키가 엔지니어링 프로토콜으로서

기술적인 건축에 대해 깊이 들어가기 전에 엔지니어들이 충분히 이야기하지 않는 것을 설명하자: 정보의 외모는 그 내용만큼이나 중요합니다.

잘 구성된 보고서나 패시보드를 보면 뇌는 3초도 안 되는 시간 안에 정신 모델을 만들어냅니다. 여러분은 본능적으로 핵심 데이터가 어디에 있는지 그리고 각 섹션의 상대적인 중요성을 알고 있습니다. 이것은 디자인이 아닙니다. 그것은 데이터 통신 프로토콜입니다.

데이터를 제시하는 방식은 사람들이 이를 통해 어떤 결정을 내리는지를 결정합니다. 정보를 구성하는 시스템을 구축할 때, 저는 단지 스케마 정확성에 대해 생각할 수 없습니다. 저는 감각적 무게에 대해 생각해야 합니다. 인간의 눈은 먼저 어떤 곳에 착륙하는가? 어떻게 그 우선순위를 렌더링 엔진이 실제로 작동할 수 있는 데이터 구조로 암호화할 수 있을까요?

** 지식 그래프: 관계들은 데이터**

데이터베이스 테이블은 사실을 저장합니다. 지식 그래프는 **의 의미를 ** 저장합니다.

제 그래프에서 모든 정보의 조각은 노드이지만 실제 지능은 가장자리에 있습니다

이러한 방식으로 데이터를 연결하면, 그것은 단지 목록이 아니라 ** 내러티브**입니다. 그것은 자연적으로 구조에서 나타납니다. 저는 특별한 이야기 생성 코드를 작성할 필요가 없습니다. 관계들은 이야기입니다.

** 데이터 밀도는: 제한은 특징**

저는 시각 공간 단위당 의미 있는 정보에 집착합니다. 밀집한 문서는 엉망이 아니라 모든 요소가 위치를 차지하는 문서는입니다. 제 시스템에서는 밀도는 엄격한 구조적 제약을 통해 강제됩니다.

** 표준화 스택: 아무도 보지 못하는 수도원

McKinsey 문제를 해결하기 위해, 저는 데이터의 무결성을 보장하기 위해 4층 스택을 만들었습니다.

  1. 정상화: 소모에 대한 이름 청소 및 말자 자사자 제거.
  2. Fuzzy Deduplication: 0.82 유사성 임대값을 사용해서 Docker 컨테이너과 Docker,를 잡을 수 있지만 Go과 Git을 분리할 수 있을 만큼 낮습니다.
  3. ** 결정적 ID:** 각 노드는 내용 (예를 들어, attr_python) 에서 유래된 ID를 얻습니다. 같은 엉뚱한 입력값을 두 번 처리하고 같은 깨끗한 그래프를 한 번 얻습니다.
  4. 변화 엔진: 데이터의 출처를 잃지 않고 업데이트와 수정 작업을 처리하는 배포 시스템.

* 실패에서 배운 것*

이 시스템은 성공보다 더 많은 것을 가르쳐 준 방법으로 실패했습니다. 한때는 머신 러닝과 머신 운영이 합쳐져 높은 유사점 점수를 공유했기 때문입니다. 그 실패는 저에게 구조적으로 유효한 것과 의미적으로 의미있는 사이의 거대한 격차를 가르쳐 주었습니다.

또한 자동 추출을 ** 신뢰되지 않는 입력으로 취급하는 것을 배웠습니다.** 이제 나는 시스템이 환각하지 않는 것을 보장하기 위해 잡음 패턴 필터를 사용합니다.

*결점

정보의 아키텍처는 신뢰의 아키텍처입니다.** 데이터가 정상화되고 의미적으로 연결되면 사람들은 출력을 신뢰합니다. 고아와 복제품으로 가득한 상태에서는 그 물질이 중요하지 않습니다.

코드를 작성하는 것만이 아니라 혼란을 질문할 수 있는 것으로 바꾸는 것입니다. 소음을 지식으로 바꾸려면 저장만 필요하지 않습니다. 건축이 필요해요

Ready to hire with precision?

Start free, invite your whole team, and see your first scored candidate in 15 minutes.

ko