Description
흩어진 네 가지 디지털 언어 자원을 하나의 통합 코퍼스로!
어휘의미론·문장의미론에서 트리뱅크와 ChatGPT까지, 고(故) 이민행 교수의 마지막 연구
어휘의미론·문장의미론에서 트리뱅크와 ChatGPT까지, 고(故) 이민행 교수의 마지막 연구
웹에 공개된 독일어 의미 자원은 많지만, 코딩에 익숙하지 않은 연구자가 그 안에서 필요한 정보를 꺼내 쓰기는 쉽지 않다. 『독일어 디지털 의미론 연구』는 E-VALBU, GermaNet, FrameSQL, PMB의 서로 다른 의미 정보를 통합 코퍼스 ICGS로 묶고, 연구와 교육에 활용하는 구체적인 방법을 제시한다. 어휘와 문장의 의미 분석에서 구구조·의존구조 트리뱅크 구축, ChatGPT를 활용한 파이썬 코드 작성까지 이어지는 고 이민행 교수의 마지막 학문적 성과다.
흩어진 언어자원을 한곳에 모으면, 독일어의 의미가 데이터로 보여
오늘날 독일어 연구자는 방대한 디지털 언어자원에 접근할 수 있다. 독일어 동사의 결합가 정보를 담은 E-VALBU, 어휘 의미망 GermaNet, 프레임 의미론에 기반한 FrameSQL, 의미역과 담화 정보를 갖춘 PMB가 대표적이다. 이 자원들은 각각 다의성, 상세 의미, 의미 부류, 결합가, 프레임, 의미역 등 중요한 정보를 제공한다. 문제는 정보의 유형과 데이터 구조, 검색 방식이 서로 달라 한 연구자가 여러 자원을 함께 활용하기가 어렵다는 데 있다.
『독일어 디지털 의미론 연구』는 이 간극을 메우기 위한 학술서다. 저자는 네 가지 디지털 자원의 구조와 특징을 하나씩 해설하고, 그 안의 의미 정보를 검색 가능한 코퍼스로 변환한 뒤 하나의 통합 의미 코퍼스 ICGS(Integrated Corpus of German Semantics)로 구축하는 절차를 제시한다. 독일어 의미론의 이론을 설명하는 데 그치지 않고, 실제 데이터를 어떻게 찾고 묶고 분석할 것인지까지 보여주는 연구 방법론이다.
책의 출발점은 분명하다. 유용한 의미 부착 코퍼스가 공개되어 있어도 코딩 능력을 갖추지 못한 일반 연구자에게는 필요한 정보를 추출하는 일이 쉽지 않다는 것이다. 저자는 Stuttgart대학교에서 개발한 CWB(Corpus Workbench)와 웹 기반 검색 플랫폼 cqpweb을 활용하면 복잡한 프로그래밍을 직접 하지 않고도 일정한 유형의 검색식을 익혀 데이터를 찾을 수 있다고 설명한다. 디지털 자료를 일부 전산언어학자의 전유물이 아니라 연구자와 교수자, 학생이 함께 활용할 수 있는 연구 기반으로 바꾸려는 시도다.
E--VALBU·GermaNet·FrameSQL·PMB, 서로 다른 네 개의 의미 지도를 읽다
책은 먼저 네 디지털 자원이 무엇을 담고 있는지 구체적인 독일어 용례를 통해 풀어낸다. E-VALBU에서는 동사의 여러 사용 의미, 형태통사적 결합가, 상세 의미, 의미 속성 제약과 용례를 살핀다. 예컨대 한 동사가 문맥에 따라 어떤 의미로 사용되고, 그 의미에 따라 어떤 보충어를 요구하며, 주어나 목적어 자리에 사람과 사물 가운데 무엇이 올 수 있는지를 데이터로 확인한다. 저자는 이러한 정보가 어휘의 다의성과 통사 구조의 상호작용을 연구하는 데 어떻게 활용되는지 단계적으로 보여 준다.
GermaNet은 개별 단어를 고립된 항목으로 제시하지 않고 동의어 집합과 의미 부류, 상하위 관계로 연결한 어휘 의미망이다. 책은 동사뿐 아니라 명사, 형용사, 합성명사까지 포괄하는 GermaNet의 구조를 설명하고, 특정 어휘의 다의성과 의미 부류, 형태통사적 결합가, 관련 용례를 추출하는 방법을 다룬다. 한 단어가 ‘인지’, ‘감정’, ‘사회관계’, ‘소통’, ‘지각’ 등 여러 의미 부류에 걸쳐 어떻게 쓰이는지 비교함으로써 사전의 풀이만으로는 포착하기 어려운 의미 관계를 데이터로 드러낸다.
FrameSQL은 문장을 하나의 사건이나 상황을 구성하는 ‘프레임’으로 분석한다. 어떤 동사가 특정 프레임을 불러오고, 그 장면에 참여하는 요소들이 문장 속에서 어떻게 실현되는지를 검색할 수 있다. PMB(Parallel Meaning Bank)는 의미역과 담화표상이론을 바탕으로 문장과 담화 차원의 의미 정보를 제공하며, 독일어와 영어의 병렬 자료도 함께 활용할 수 있게 한다. 저자는 어휘 차원의 정보에 강한 E-VALBU·GermaNet과 문장 및 담화 차원의 정보에 강한 FrameSQL·PMB를 상호 보완적인 자원으로 읽는다.
이 네 자원을 차례로 설명하는 구성은 독자가 디지털 의미론의 지형을 자연스럽게 익히도록 돕는다. ‘어떤 자원이 더 우수한가’를 가리는 대신, 연구 질문에 따라 어떤 자원의 어떤 정보를 선택해야 하는지를 보여 준다. 다의성을 연구할 때, 의미 부류를 비교할 때, 동사의 결합가를 살필 때, 프레임과 의미역을 분석할 때 필요한 자료와 검색 방식이 달라진다는 사실을 실제 용례와 통계로 확인할 수 있다.
네 개의 데이터 구조를 통합한 ICGS, 연구 질문을 한 번에 비교
이 책의 중심 성과는 통합 의미 코퍼스 ICGS의 구축과 활용이다. E-VALBU, GermaNet, FrameSQL, PMB는 데이터의 단위와 구조가 서로 다르다. 저자는 각 자원을 개별 코퍼스로 구축한 뒤, 공통으로 비교할 수 있는 정보와 자원별 고유 정보를 구분하여 통합한다. CWB로 인코딩하고 등록 파일을 구성하는 명령식, 위치 속성과 구조 속성을 설정하는 방식, 검색 결과를 파일로 추출하는 과정까지 실제 연구자가 따라갈 수 있도록 기술한다.
통합의 장점은 동일한 단어와 현상을 여러 의미 체계에서 한꺼번에 비교할 수 있다는 데 있다. 한 동사가 E-VALBU에서는 어떤 사용 의미와 결합가 틀로 기술되는지, GermaNet에서는 어느 의미 부류에 속하는지, FrameSQL에서는 어떤 프레임을 실현하는지, PMB에서는 어떤 의미역 구조를 보이는지 연결해 살필 수 있다. 서로 흩어져 있던 정보를 나란히 놓는 순간, 개별 자원만 보아서는 드러나지 않던 공통점과 차이점이 연구 대상으로 바뀐다.
책은 ICGS를 구축하는 데서 멈추지 않는다. 통합 코퍼스를 활용해 소통동사의 의미적 특성, 독일어의 상해 입히기 프레임, 다의성, GermaNet의 활용 등 구체적인 주제 연구를 수행한다. 특정 의미 부류에 속하는 동사 목록을 만들고, 출현 빈도와 프레임 분포를 확인하며, 실제 문장에서 논항과 의미역이 어떻게 실현되는지 검토한다. 데이터 구축이 연구의 준비 단계라면, 이 장은 구축한 데이터가 새로운 질문과 분석으로 이어지는 과정을 보여 주는 실전편이다.
5만 664개 문장을 트리뱅크로, 의미론을 통사론과 교육으로 확장
ICGS에 포함된 5만 664개 문장은 다시 구구조 트리뱅크와 의존구조 트리뱅크의 원천 자료가 된다. 구구조 트리뱅크는 문장을 명사구와 동사구 같은 구성 성분의 계층으로 분석하고, 의존구조 트리뱅크는 문장 속 단어들 사이의 지배·의존 관계를 표현한다. 저자는 spaCy 등 언어 처리 도구를 활용해 문장을 파싱하고, 분석 결과를 검색 시스템에서 활용할 수 있는 형식으로 변환하는 과정을 설명한다.
구구조 트리뱅크에서는 품사와 어휘의 빈도, 명사구와 동사구의 구조, 특정 통사 패턴을 검색할 수 있다. 의미역 정보를 함께 부착하면 주어와 목적어가 사건에서 어떤 역할을 수행하는지도 수형도로 표현할 수 있다. 의존구조 트리뱅크에서는 주어·목적어·수식어 등 문장 성분의 관계를 더 직접적으로 추적하고, 특정 격 틀을 취하는 동사나 분리동사의 용법을 찾아낼 수 있다.
이 작업은 독일어 의미론의 범위를 통사론과 언어교육으로 넓힌다. 실제 문장에 나타난 품사와 구조의 분포를 확인할 수 있고, 중급 이상의 독일어 수업에서 문법 현상을 실제 용례로 제시할 수도 있다. 사전에 정리된 규칙을 일방적으로 전달하는 교육에서 벗어나, 학습자가 코퍼스를 검색하고 패턴을 발견하도록 돕는 데이터 기반 교육의 토대가 된다.
ChatGPT에 코드를 묻고, 연구자는 언어학적 질문에 집중
제11장 ‘ChatGPT와 동행하는 언어학 연구’는 이 책이 전통적인 독어학 연구에 머물지 않는다는 점을 가장 선명하게 보여 준다. 저자는 언어학 연구에 필요한 파이썬 코드를 ChatGPT에 어떻게 요청하고, 받은 코드가 어떤 기능을 수행하며, 실제 데이터 처리에 어떻게 적용되는지를 설명한다. 단어의 출현 빈도 계산, 독일어 텍스트의 품사 및 기본형 태깅, 빈도와 누적 백분율 산출, 독한 문장쌍 정리, 의존구조 분석과 CoNLL-U 형식 출력 등이 구체적인 과제로 제시된다.
중요한 것은 ChatGPT를 연구 결과를 대신 만들어 주는 도구로 보지 않는다는 점이다. 연구자가 필요한 작업을 정확히 정의하고 입력·출력 형식과 조건을 제시하면, 생성형 AI가 코딩의 진입장벽을 낮추는 협업 도구가 될 수 있다는 접근이다. 코드를 받은 뒤에는 각 함수의 역할과 실행 조건을 이해하고, 결과가 연구 목적에 맞는지 확인해야 한다. 이 책은 프롬프트와 코드, 실행 결과를 함께 보여 줌으로써 ‘AI를 활용한 언어학 연구’가 실제로 어떤 절차를 거치는지 공개한다.
따라서 이 장은 프로그래밍 경험이 부족한 인문학 연구자에게 특히 현실적인 안내가 된다. 파이썬의 변수와 자료형, 조건문, 반복문, 함수, 파일 입출력 같은 기초를 설명하고, 추가로 필요한 코드를 ChatGPT에 요청해 연구 과제에 맞게 확장하는 방법을 제안한다. 연구자는 모든 코드를 처음부터 직접 작성하는 부담을 덜고, 어떤 데이터를 왜 분석할 것인지라는 학문적 판단에 더 집중할 수 있다.
연구자가 실제로 ‘재현할 수 있는’ 과정 남겨
『독일어 디지털 의미론 연구』의 또 다른 특징은 완성된 통계표만 제시하지 않고, 그 결과에 도달하는 절차를 드러낸다는 데 있다. 자원의 데이터 구조를 확인하고, 태그와 속성을 정하고, CWB에서 코퍼스를 인코딩하고, 검색식을 실행해 결과를 추출하는 순서가 제시된다. 트리뱅크를 구축할 때도 원문 문장을 어떤 형식으로 준비하고, 파서의 결과를 어떤 데이터 형식으로 저장하며, 검색 시스템에 올리기 전에 무엇을 수정해야 하는지 설명한다.
이러한 서술 방식은 연구의 재현 가능성과 연결된다. 독자는 저자의 결론을 단순히 받아들이는 대신 같은 자원과 검색식을 이용해 결과를 다시 확인할 수 있다. 연구 목적에 따라 검색 조건을 바꾸거나 새로운 동사와 의미 부류를 선택해 후속 연구를 설계할 수도 있다. 책에 실린 명령식과 코드, 표와 용례는 고정된 정답이라기보다 새로운 분석을 시작하기 위한 연구 도구에 가깝다.
부록에는 GermaNet의 4격 재귀동사 목록, PMB-DE 의미 범주 태그셋, ICGS 하위 코퍼스의 공통 동사 목록, 의존 트리뱅크의 의존 기능 목록과 분리동사 목록 등이 수록돼 있다. 본문에서 논의한 분석이 어떤 데이터에 기초했는지를 확인할 수 있을 뿐 아니라, 새로운 연구 주제를 탐색할 때 참고 자료로 사용할 수 있다. 이론 설명과 자료 구축, 검색과 분석, 결과 검증을 한 권 안에 연결한 구성이다.
독어학 연구자부터 코퍼스 언어학 입문자까지
이 책의 일차 독자는 독일어 의미론과 독어학을 연구하거나 가르치는 연구자와 교수자, 대학원생이다. E-VALBU와 GermaNet 등 개별 자원을 이미 알고 있지만 여러 자원을 함께 활용하지 못했던 독자에게는 통합 분석의 설계도를 제공한다. 코퍼스 검색을 처음 시작하는 독자에게는 각 자원의 특징과 검색 대상, 결과 해석의 기본 원리를 익히게 한다.
전산언어학과 코퍼스 언어학에 관심 있는 인문학 연구자에게도 의미가 있다. 책은 코딩 자체를 목표로 삼지 않고, 연구 질문에 필요한 만큼 디지털 도구를 사용하는 데 초점을 맞춘다. 검색식 몇 가지로 코퍼스에서 정보를 추출하는 단계부터 시작해, 생성형 AI의 도움을 받아 파이썬 코드를 만들고 대규모 데이터를 처리하는 단계로 나아간다. 디지털 전환 앞에서 연구 방법을 어디서부터 바꾸어야 할지 막막했던 독자에게 현실적인 경로를 보여 준다.
독일어교육 현장에서는 실제 문장에 기반한 어휘·문법 자료를 만들고, 학습자가 언어 패턴을 직접 발견하는 수업을 설계하는 데 활용할 수 있다. 한 동사의 여러 의미와 결합가를 비교하거나, 특정 문법 구조가 실제로 얼마나 자주 나타나는지 확인하고, 문장의 구구조와 의존관계를 시각적으로 살피는 활동이 가능하다. 연구용 데이터가 교육 자료로 확장되는 과정까지 보여 준다는 점에서 의미론 연구서이면서 동시에 디지털 독어학의 방법 안내서다.
흩어진 언어자원을 한곳에 모으면, 독일어의 의미가 데이터로 보여
오늘날 독일어 연구자는 방대한 디지털 언어자원에 접근할 수 있다. 독일어 동사의 결합가 정보를 담은 E-VALBU, 어휘 의미망 GermaNet, 프레임 의미론에 기반한 FrameSQL, 의미역과 담화 정보를 갖춘 PMB가 대표적이다. 이 자원들은 각각 다의성, 상세 의미, 의미 부류, 결합가, 프레임, 의미역 등 중요한 정보를 제공한다. 문제는 정보의 유형과 데이터 구조, 검색 방식이 서로 달라 한 연구자가 여러 자원을 함께 활용하기가 어렵다는 데 있다.
『독일어 디지털 의미론 연구』는 이 간극을 메우기 위한 학술서다. 저자는 네 가지 디지털 자원의 구조와 특징을 하나씩 해설하고, 그 안의 의미 정보를 검색 가능한 코퍼스로 변환한 뒤 하나의 통합 의미 코퍼스 ICGS(Integrated Corpus of German Semantics)로 구축하는 절차를 제시한다. 독일어 의미론의 이론을 설명하는 데 그치지 않고, 실제 데이터를 어떻게 찾고 묶고 분석할 것인지까지 보여주는 연구 방법론이다.
책의 출발점은 분명하다. 유용한 의미 부착 코퍼스가 공개되어 있어도 코딩 능력을 갖추지 못한 일반 연구자에게는 필요한 정보를 추출하는 일이 쉽지 않다는 것이다. 저자는 Stuttgart대학교에서 개발한 CWB(Corpus Workbench)와 웹 기반 검색 플랫폼 cqpweb을 활용하면 복잡한 프로그래밍을 직접 하지 않고도 일정한 유형의 검색식을 익혀 데이터를 찾을 수 있다고 설명한다. 디지털 자료를 일부 전산언어학자의 전유물이 아니라 연구자와 교수자, 학생이 함께 활용할 수 있는 연구 기반으로 바꾸려는 시도다.
E--VALBU·GermaNet·FrameSQL·PMB, 서로 다른 네 개의 의미 지도를 읽다
책은 먼저 네 디지털 자원이 무엇을 담고 있는지 구체적인 독일어 용례를 통해 풀어낸다. E-VALBU에서는 동사의 여러 사용 의미, 형태통사적 결합가, 상세 의미, 의미 속성 제약과 용례를 살핀다. 예컨대 한 동사가 문맥에 따라 어떤 의미로 사용되고, 그 의미에 따라 어떤 보충어를 요구하며, 주어나 목적어 자리에 사람과 사물 가운데 무엇이 올 수 있는지를 데이터로 확인한다. 저자는 이러한 정보가 어휘의 다의성과 통사 구조의 상호작용을 연구하는 데 어떻게 활용되는지 단계적으로 보여 준다.
GermaNet은 개별 단어를 고립된 항목으로 제시하지 않고 동의어 집합과 의미 부류, 상하위 관계로 연결한 어휘 의미망이다. 책은 동사뿐 아니라 명사, 형용사, 합성명사까지 포괄하는 GermaNet의 구조를 설명하고, 특정 어휘의 다의성과 의미 부류, 형태통사적 결합가, 관련 용례를 추출하는 방법을 다룬다. 한 단어가 ‘인지’, ‘감정’, ‘사회관계’, ‘소통’, ‘지각’ 등 여러 의미 부류에 걸쳐 어떻게 쓰이는지 비교함으로써 사전의 풀이만으로는 포착하기 어려운 의미 관계를 데이터로 드러낸다.
FrameSQL은 문장을 하나의 사건이나 상황을 구성하는 ‘프레임’으로 분석한다. 어떤 동사가 특정 프레임을 불러오고, 그 장면에 참여하는 요소들이 문장 속에서 어떻게 실현되는지를 검색할 수 있다. PMB(Parallel Meaning Bank)는 의미역과 담화표상이론을 바탕으로 문장과 담화 차원의 의미 정보를 제공하며, 독일어와 영어의 병렬 자료도 함께 활용할 수 있게 한다. 저자는 어휘 차원의 정보에 강한 E-VALBU·GermaNet과 문장 및 담화 차원의 정보에 강한 FrameSQL·PMB를 상호 보완적인 자원으로 읽는다.
이 네 자원을 차례로 설명하는 구성은 독자가 디지털 의미론의 지형을 자연스럽게 익히도록 돕는다. ‘어떤 자원이 더 우수한가’를 가리는 대신, 연구 질문에 따라 어떤 자원의 어떤 정보를 선택해야 하는지를 보여 준다. 다의성을 연구할 때, 의미 부류를 비교할 때, 동사의 결합가를 살필 때, 프레임과 의미역을 분석할 때 필요한 자료와 검색 방식이 달라진다는 사실을 실제 용례와 통계로 확인할 수 있다.
네 개의 데이터 구조를 통합한 ICGS, 연구 질문을 한 번에 비교
이 책의 중심 성과는 통합 의미 코퍼스 ICGS의 구축과 활용이다. E-VALBU, GermaNet, FrameSQL, PMB는 데이터의 단위와 구조가 서로 다르다. 저자는 각 자원을 개별 코퍼스로 구축한 뒤, 공통으로 비교할 수 있는 정보와 자원별 고유 정보를 구분하여 통합한다. CWB로 인코딩하고 등록 파일을 구성하는 명령식, 위치 속성과 구조 속성을 설정하는 방식, 검색 결과를 파일로 추출하는 과정까지 실제 연구자가 따라갈 수 있도록 기술한다.
통합의 장점은 동일한 단어와 현상을 여러 의미 체계에서 한꺼번에 비교할 수 있다는 데 있다. 한 동사가 E-VALBU에서는 어떤 사용 의미와 결합가 틀로 기술되는지, GermaNet에서는 어느 의미 부류에 속하는지, FrameSQL에서는 어떤 프레임을 실현하는지, PMB에서는 어떤 의미역 구조를 보이는지 연결해 살필 수 있다. 서로 흩어져 있던 정보를 나란히 놓는 순간, 개별 자원만 보아서는 드러나지 않던 공통점과 차이점이 연구 대상으로 바뀐다.
책은 ICGS를 구축하는 데서 멈추지 않는다. 통합 코퍼스를 활용해 소통동사의 의미적 특성, 독일어의 상해 입히기 프레임, 다의성, GermaNet의 활용 등 구체적인 주제 연구를 수행한다. 특정 의미 부류에 속하는 동사 목록을 만들고, 출현 빈도와 프레임 분포를 확인하며, 실제 문장에서 논항과 의미역이 어떻게 실현되는지 검토한다. 데이터 구축이 연구의 준비 단계라면, 이 장은 구축한 데이터가 새로운 질문과 분석으로 이어지는 과정을 보여 주는 실전편이다.
5만 664개 문장을 트리뱅크로, 의미론을 통사론과 교육으로 확장
ICGS에 포함된 5만 664개 문장은 다시 구구조 트리뱅크와 의존구조 트리뱅크의 원천 자료가 된다. 구구조 트리뱅크는 문장을 명사구와 동사구 같은 구성 성분의 계층으로 분석하고, 의존구조 트리뱅크는 문장 속 단어들 사이의 지배·의존 관계를 표현한다. 저자는 spaCy 등 언어 처리 도구를 활용해 문장을 파싱하고, 분석 결과를 검색 시스템에서 활용할 수 있는 형식으로 변환하는 과정을 설명한다.
구구조 트리뱅크에서는 품사와 어휘의 빈도, 명사구와 동사구의 구조, 특정 통사 패턴을 검색할 수 있다. 의미역 정보를 함께 부착하면 주어와 목적어가 사건에서 어떤 역할을 수행하는지도 수형도로 표현할 수 있다. 의존구조 트리뱅크에서는 주어·목적어·수식어 등 문장 성분의 관계를 더 직접적으로 추적하고, 특정 격 틀을 취하는 동사나 분리동사의 용법을 찾아낼 수 있다.
이 작업은 독일어 의미론의 범위를 통사론과 언어교육으로 넓힌다. 실제 문장에 나타난 품사와 구조의 분포를 확인할 수 있고, 중급 이상의 독일어 수업에서 문법 현상을 실제 용례로 제시할 수도 있다. 사전에 정리된 규칙을 일방적으로 전달하는 교육에서 벗어나, 학습자가 코퍼스를 검색하고 패턴을 발견하도록 돕는 데이터 기반 교육의 토대가 된다.
ChatGPT에 코드를 묻고, 연구자는 언어학적 질문에 집중
제11장 ‘ChatGPT와 동행하는 언어학 연구’는 이 책이 전통적인 독어학 연구에 머물지 않는다는 점을 가장 선명하게 보여 준다. 저자는 언어학 연구에 필요한 파이썬 코드를 ChatGPT에 어떻게 요청하고, 받은 코드가 어떤 기능을 수행하며, 실제 데이터 처리에 어떻게 적용되는지를 설명한다. 단어의 출현 빈도 계산, 독일어 텍스트의 품사 및 기본형 태깅, 빈도와 누적 백분율 산출, 독한 문장쌍 정리, 의존구조 분석과 CoNLL-U 형식 출력 등이 구체적인 과제로 제시된다.
중요한 것은 ChatGPT를 연구 결과를 대신 만들어 주는 도구로 보지 않는다는 점이다. 연구자가 필요한 작업을 정확히 정의하고 입력·출력 형식과 조건을 제시하면, 생성형 AI가 코딩의 진입장벽을 낮추는 협업 도구가 될 수 있다는 접근이다. 코드를 받은 뒤에는 각 함수의 역할과 실행 조건을 이해하고, 결과가 연구 목적에 맞는지 확인해야 한다. 이 책은 프롬프트와 코드, 실행 결과를 함께 보여 줌으로써 ‘AI를 활용한 언어학 연구’가 실제로 어떤 절차를 거치는지 공개한다.
따라서 이 장은 프로그래밍 경험이 부족한 인문학 연구자에게 특히 현실적인 안내가 된다. 파이썬의 변수와 자료형, 조건문, 반복문, 함수, 파일 입출력 같은 기초를 설명하고, 추가로 필요한 코드를 ChatGPT에 요청해 연구 과제에 맞게 확장하는 방법을 제안한다. 연구자는 모든 코드를 처음부터 직접 작성하는 부담을 덜고, 어떤 데이터를 왜 분석할 것인지라는 학문적 판단에 더 집중할 수 있다.
연구자가 실제로 ‘재현할 수 있는’ 과정 남겨
『독일어 디지털 의미론 연구』의 또 다른 특징은 완성된 통계표만 제시하지 않고, 그 결과에 도달하는 절차를 드러낸다는 데 있다. 자원의 데이터 구조를 확인하고, 태그와 속성을 정하고, CWB에서 코퍼스를 인코딩하고, 검색식을 실행해 결과를 추출하는 순서가 제시된다. 트리뱅크를 구축할 때도 원문 문장을 어떤 형식으로 준비하고, 파서의 결과를 어떤 데이터 형식으로 저장하며, 검색 시스템에 올리기 전에 무엇을 수정해야 하는지 설명한다.
이러한 서술 방식은 연구의 재현 가능성과 연결된다. 독자는 저자의 결론을 단순히 받아들이는 대신 같은 자원과 검색식을 이용해 결과를 다시 확인할 수 있다. 연구 목적에 따라 검색 조건을 바꾸거나 새로운 동사와 의미 부류를 선택해 후속 연구를 설계할 수도 있다. 책에 실린 명령식과 코드, 표와 용례는 고정된 정답이라기보다 새로운 분석을 시작하기 위한 연구 도구에 가깝다.
부록에는 GermaNet의 4격 재귀동사 목록, PMB-DE 의미 범주 태그셋, ICGS 하위 코퍼스의 공통 동사 목록, 의존 트리뱅크의 의존 기능 목록과 분리동사 목록 등이 수록돼 있다. 본문에서 논의한 분석이 어떤 데이터에 기초했는지를 확인할 수 있을 뿐 아니라, 새로운 연구 주제를 탐색할 때 참고 자료로 사용할 수 있다. 이론 설명과 자료 구축, 검색과 분석, 결과 검증을 한 권 안에 연결한 구성이다.
독어학 연구자부터 코퍼스 언어학 입문자까지
이 책의 일차 독자는 독일어 의미론과 독어학을 연구하거나 가르치는 연구자와 교수자, 대학원생이다. E-VALBU와 GermaNet 등 개별 자원을 이미 알고 있지만 여러 자원을 함께 활용하지 못했던 독자에게는 통합 분석의 설계도를 제공한다. 코퍼스 검색을 처음 시작하는 독자에게는 각 자원의 특징과 검색 대상, 결과 해석의 기본 원리를 익히게 한다.
전산언어학과 코퍼스 언어학에 관심 있는 인문학 연구자에게도 의미가 있다. 책은 코딩 자체를 목표로 삼지 않고, 연구 질문에 필요한 만큼 디지털 도구를 사용하는 데 초점을 맞춘다. 검색식 몇 가지로 코퍼스에서 정보를 추출하는 단계부터 시작해, 생성형 AI의 도움을 받아 파이썬 코드를 만들고 대규모 데이터를 처리하는 단계로 나아간다. 디지털 전환 앞에서 연구 방법을 어디서부터 바꾸어야 할지 막막했던 독자에게 현실적인 경로를 보여 준다.
독일어교육 현장에서는 실제 문장에 기반한 어휘·문법 자료를 만들고, 학습자가 언어 패턴을 직접 발견하는 수업을 설계하는 데 활용할 수 있다. 한 동사의 여러 의미와 결합가를 비교하거나, 특정 문법 구조가 실제로 얼마나 자주 나타나는지 확인하고, 문장의 구구조와 의존관계를 시각적으로 살피는 활동이 가능하다. 연구용 데이터가 교육 자료로 확장되는 과정까지 보여 준다는 점에서 의미론 연구서이면서 동시에 디지털 독어학의 방법 안내서다.
독일어 디지털 의미론 연구 (독일어 의미 연구, 코딩의 벽을 넘다)
$37.00